Qwen 3.8 Max: probé el modelo gratis de Alibaba (y esto es lo que nadie te cuenta)
Alibaba dice que Qwen 3.8 Max es el nº2 del mundo, solo por detrás de Fable 5. Lo pruebo gratis con 3 casos reales, te doy mi veredicto y te explico el asterisco gigante: no hay benchmarks públicos.
Alibaba dice que es el nº 2 del mundo. ¿Es verdad?
Alibaba acaba de presentar Qwen 3.8 Max y no se ha cortado ni un pelo: dice que es el segundo mejor modelo del mundo, que el único capaz de superarlo hoy es Fable 5 de Anthropic, y que queda por encima de GPT-5.5 y de todos los Opus. Cuando una empresa suelta algo así, yo no me lo creo hasta probarlo con mis propias manos. Y eso es justo lo que vamos a hacer.
Nada de tablas ni benchmarks aburridos: le voy a dar tres encargos reales al modelo (y los mismos a Fable 5) para ver, sin rodeos, si hay tanta diferencia o no. Y lo mejor: se puede probar gratis, así que puedes replicarlo tú mismo. Pero antes de las pruebas, hay un asterisco enorme que tienes que conocer.
Qué es Qwen 3.8 Max
Alibaba presentó Qwen3.8-Max-Preview el 19 de julio de 2026 en la World AI Conference (WAIC) de Shanghái, con unas cifras que impresionan:
- 2,4 billones de parámetros (2,4 trillones en escala anglosajona). Es el primer modelo multimodal de Qwen por encima del billón de parámetros.
- Arquitectura MoE (Mixture of Experts) dispersa: de esos 2,4 billones, solo una fracción se activa por cada token. ¿Cuántos exactamente? No lo han publicado — y ese dato es justo el que determina la velocidad y el coste real. Nadie fuera de Alibaba lo sabe.
- Multimodal: procesa texto, imágenes, vídeo y documentos (aunque las guías de integración de momento solo confirman texto e imagen como entrada).
- Ventana de contexto de ~1 millón de tokens (983.616 según los metadatos oficiales) y hasta 131.072 tokens de salida.
El asterisco gigante: no hay forma de verificarlo
Aquí está lo que casi ningún titular te cuenta, y es lo más importante: Alibaba no ha publicado NADA con lo que comprobar sus afirmaciones. Ni ficha técnica (model card), ni licencia, ni tabla de benchmarks, ni el número de parámetros activos, ni siquiera qué pruebas respaldan ese “segundo solo por detrás de Fable 5”.
- Ningún benchmark independiente lo ha puntuado. Ni Artificial Analysis ni LMArena lo tienen evaluado. El ranking que presume Alibaba es autoevaluación de marketing.
- Las “reviews” que circulan son transparentes: no lo han probado a fondo porque nadie fuera de Alibaba puede ejecutarlo todavía. Se basan en demos y en los claims de la propia empresa.
- Como referencia de cautela: su predecesor, Qwen 3.7 Max, puntuaba 56,6 en el índice de inteligencia de Artificial Analysis en mayo… y bajó a 46 en julio. Las cifras de Alibaba y las de terceros no siempre coinciden.
Traducción honesta: es un anuncio de posicionamiento (una respuesta a Kimi K3, ahora lo vemos) más que un producto verificado y listo para producción. Con eso en mente, vamos a las pruebas.
Cómo probarlo gratis
Hay dos caminos:
- Gratis: entra en Qwen Chat (chat.qwen.ai), regístrate y, desplegando el selector de modelo, aparece la vista previa de Qwen 3.8 Max. Tiene límite de uso, pero en mis tres pruebas no me puso ninguna pega. Es la vía que recomiendo para probarlo sin gastar un céntimo.
- De pago (Token Plan de Alibaba): por créditos, desde el plan Lite a 6 $/mes (2.500 créditos/7 días), Standard 18 $ o Pro 68 $. Durante la preview se factura al 10% del precio estándar. Ojo: no hay precio público por millón de tokens para este modelo; todo va por créditos y no publican la conversión, así que no se puede presupuestar con rigor todavía.
Las 3 pruebas (mismo prompt para todos, cero iteraciones)
La regla del experimento: una sola instrucción. Lo que salga a la primera, sale.
Prueba 1 — Landing page creativa (Qwen vs Kimi K3 vs Fable 5)
Cogí una web que había generado Kimi K3 con un único prompt (una landing “Neon” muy interactiva) y le pasé ese mismo prompt a Qwen 3.8 y a Fable 5.
- Qwen generó ~1.500 líneas de HTML autocontenido, responsive, imitando muy bien el efecto de tarjetas y el scroll deslizante. Único fallo: escribió mal la palabra “vórtice” en pantalla. Por lo demás, aprueba con nota.
- Fable 5 sí escribió bien el texto y quedó muy parecido, aunque un pelín más lento y con un efecto de tarjetas algo menos vistoso. En este apartado concreto, para mi gusto, Qwen ganó en las tarjetas 3D.
- Kimi K3 seguía por delante en el hero y el acabado global.
Prueba 2 — Juego espacial de disparos
Mismo prompt para los dos. Ambos generaron un HTML jugable, interactivo, con su game over. Resultado: prácticamente idénticos. En diseño, Qwen no mintió: está al nivel.
Prueba 3 — Planificador de eventos interactivo
Le pedí una web para planificar un evento (boda/cumpleaños) con agenda, invitados y tareas.
- Qwen hizo algo funcional (añadir tareas, marcarlas), pero no dejaba editar partes clave de la agenda.
- Fable 5 me gustó más: permitía cambiar fechas y horas, añadir/eliminar momentos, crear grupos de invitados… una vuelta de tuerca más de inteligencia en el aplicativo.
Mi veredicto honesto
Para ser una preview que ni siquiera está al 100% ni tiene benchmarks publicados, Qwen 3.8 Max funciona bastante bien. Sin autoengaños:
- Le ganan Fable 5, Kimi K3 y (por lo que he trabajado con él) GPT-5.6 Sol. Y muy probablemente Opus 4.8 también supera a esta versión preview.
- Lo que me gusta: es rápido, razona bien, tiene buen gusto de diseño y es multimodal. En tareas sencillas está muy cerca del nivel del resto.
- Fable 5 suele añadir funcionalidades extra por su cuenta (es más autónomo), y lo sigo viendo por encima para todo tipo de tareas.
El contexto que de verdad importa: Kimi K3
Aquí está la historia real detrás del lanzamiento. Qwen 3.8 Max salió tres días después de que Moonshot lanzara Kimi K3 (16 de julio), y el timing se lee como una respuesta. La diferencia entre ambos es demoledora en lo que importa:
- Kimi K3 tiene 2,8 billones de parámetros (más que Qwen) y es open-weight de verdad (pesos completos liberados, sin la promesa vaga de “pronto”).
- Y sobre todo: Kimi K3 SÍ tiene benchmarks reales e independientes. Es nº 1 en Frontend Code Arena con 1.679 puntos, por delante de Claude Fable 5 (1.631), GPT-5.6 Sol (1.618) y GLM-5.2 (1.587). En el índice general de Artificial Analysis puntúa 57 (puesto 4 de 189), a la par de Opus 4.8 y GPT-5.5.
Se hizo tan popular que Moonshot tuvo que suspender nuevas suscripciones en 48 horas por saturación. Ese es el modelo chino que hay que mirar ahora mismo — con datos, no con claims.
Los modelos chinos están acelerando (esto sí es real)
La conclusión más interesante no es la nota de Qwen, sino la tendencia de fondo, y esta sí está respaldada: 4 de los 10 mejores modelos del ranking de Artificial Analysis son chinos. Y cada uno se está especializando:
- DeepSeek — el generalista más barato (y open-weight).
- Qwen — la base más adaptable para construir encima.
- GLM — frontera de código.
- Kimi — el de agentes de largo recorrido multi-paso.
Todos con estrategia open-weight, frente a los sistemas cerrados de OpenAI y Anthropic. Se acercan a los punteros (para mí, Anthropic el nº1 y OpenAI el nº2) pese a las restricciones de cómputo. Es una carrera cada vez más apretada.
¿Sirve para tu empresa? Léelo antes de usarlo
Es un modelo potente, pero antes de meterlo en un proyecto de cliente, ten claros los riesgos reales:
- Es una preview: puede cambiar o retirarse. No ates un producto de cara al cliente a un modelo “preview”.
- Rendimiento sin verificar: el ranking es autoevaluación de Alibaba, sin benchmarks de terceros.
- Licencia indefinida: “open-weight pronto” sin fecha ni términos → uso comercial legalmente incierto hoy.
- Soberanía del dato: el acceso obliga a usar la nube de Alibaba → tus datos salen de tu control. Crítico para clientes en la UE o sectores regulados.
- Auto-hospedaje inviable: a 4-bit, 2,4 billones de parámetros son ~1,2 TB solo de pesos. Fuera del alcance de casi cualquiera.
Conclusión
Qwen 3.8 Max es un modelo rápido y sorprendentemente competente en diseño y desarrollo simple, gratis de probar ahora mismo en preview. Pero el “nº 2 del mundo” es, hoy por hoy, una afirmación de marketing sin una sola prueba independiente detrás. Si quieres ver el modelo chino que de verdad está moviendo el tablero con datos reales, mira a Kimi K3. Y la foto grande es clara: los modelos chinos aprietan cada vez más.
En ExpertBrain ayudamos a empresas a elegir y aplicar el modelo adecuado para cada caso — con criterio, mirando datos reales y no titulares, y con la seguridad y soberanía del dato que tu negocio necesita. Si quieres sacarle partido a la IA sin jugártela, hablemos.
Recursos del vídeo: 🔥 ¿Quieres montar tu propio agente de IA en un VPS? Consíguelo con un 10% de descuento extra usando el código EXPERTBRAIN en Hostinger.
Te ayudamos a aterrizar la última IA en tu empresa
Estamos al día de cada novedad para que tú no tengas que estarlo. Te decimos qué tiene sentido aplicar y qué no.