IA de código abierto: Alibaba abre el nivel Max
Qwen 3.8-Max: el modelo más potente de Alibaba ya se puede descargar gratis
Alibaba está publicando como código abierto Qwen 3.8-Max, su modelo más capaz hasta la fecha: un MoE de 2,4 billones de parámetros que supera a GPT-5.6 Sol en SWE-bench Pro, PaperBench e IFBench. Analizamos las salvedades de los benchmarks y lo que significa un modelo insignia abierto con 95 mil millones de parámetros activos para los desarrolladores.
Emmanuel Fabrice Omgbwa Yasse Asistido por IA
2026-08-16 · 5 min de lectura

El nivel Max era la parte de Qwen que nadie podía descargar. Los modelos insignia de Alibaba permanecían tras las APIs mientras que los lanzamientos más pequeños ofrecían pesos abiertos. Qwen 3.8-Max termina con eso. El anuncio lo define como el modelo más capaz de la familia Qwen hasta la fecha y el primer lanzamiento de la clase Qwen-Max con pesos abiertos, publicado a través de Hugging Face y ModelScope, un cambio que señalamos antes del lanzamiento. Escala hasta 2.4 billones de parámetros totales, activando 95 mil millones por token, sobre la arquitectura que introdujo Qwen 3.5.
Ya tiene un historial de la era cerrada. En un lapso de 24 horas, Qwen 3.8-Max venció a 458 equipos humanos que trabajaron solos, como se informó en el reporte del concurso de 24 horas. Después vino una ejecución autónoma de 16 días que produjo un framework de agentes y un segundo puesto en Vision Arena, documentada en la cobertura de la ejecución de 16 días. Esas capacidades están a punto de ser reproducibles en cualquier lugar donde el modelo pueda servirse.
El nivel Max cerrado de Alibaba acaba de abrirse
Es una ruptura estratégica, no un gesto de buena voluntad. Alibaba ha consolidado su trabajo de IA en una sola unidad cuya misión declarada es "crear, entregar y aplicar tokens", respaldada por un impulso de inversión de 53 mil millones de dólares, según nuestro desglose de ese gasto. La compañía lanza una flota de modelos en lugar de un único campeón, una jugada de plataforma que mapeamos en el análisis estratégico anterior, y el trato aquí es claro: los pesos son gratuitos, mientras que Qwen Cloud y las herramientas de servicio que lo rodean son el canal de pago. Ese canal de pago ahora agrupa modelos de texto, visión, voz e imagen en una sola suscripción, según la cobertura del plan de Qwen Cloud. Un detalle importa para cualquiera que planee ejecutar el modelo insignia: la variante abierta de 2.4 T, Qwen3.8-2.4T-A95B, es solo de texto y exige el modo de pensamiento en cada interacción. Las entradas multimodales no son compatibles y el pensamiento no se puede desactivar, aunque la base Qwen 3.5 subyacente fue entrenada como un modelo unificado de visión y lenguaje.
Dónde gana Qwen 3.8-Max frente a GPT-5.6 Sol y dónde pierde
Según las cifras del anuncio, Qwen 3.8-Max supera a su predecesor en casi todas las filas. Frente a los rivales cerrados, las victorias son reales pero desiguales. Obtiene las mejores marcas en PaperBench (93.0, por delante de los 90.5 de GPT-5.6 Sol), seguimiento de instrucciones (IFBench 82.8 frente a 72.7) y uso de computadora (OSWorld-Verified 86.1), y supera a GPT-5.6 Sol por poco en SWE-bench Pro, 67.7 a 64.6. En otros lugares, la ventaja se invierte. Fable 5 sigue muy por delante en ese mismo benchmark con 80.0; GPT-5.6 Sol lidera Terminal Bench 2.1 con 88.8 frente a 86.6; y en GPQA Diamond el mejor número es el 94.1 de GPT-5.6 Sol.
| Benchmark | Qwen 3.8-Max | Qwen 3.7-Max | GPT-5.6 Sol | Fable 5 | Opus 4.8 |
|---|---|---|---|---|---|
| Terminal Bench 2.1 | 86.6 | 74.5 | 88.8 | 84.6 | 84.6 |
| SWE-bench Pro | 67.7 | 60.6 | 64.6 | 80.0 | 69.2 |
| DeepSWE 1.1 | 56.6 | 21.6 | 73.0 | 70.0 | 59.0 |
| PaperBench | 93.0 | 64.8 | 90.5 | 88.8 | 80.3 |
| GPQA Diamond | 92.6 | 92.4 | 94.1 | 92.6 | 92.0 |
| IFBench | 82.8 | 79.1 | 72.7 | 63.5 | 62.2 |
Puntuaciones publicadas por el equipo de Qwen. Según las notas a pie de página del anuncio, los resultados de Fable 5 pueden implicar mecanismos de respaldo.
Al leer las filas, aparece un patrón: Qwen lidera en seguimiento de instrucciones, reproducción de artículos y uso de computadora, mientras que la ingeniería de software a escala de repositorio y el razonamiento difícil siguen favoreciendo a los modelos cerrados. La línea base de SWE-bench Pro es además la versión corregida del propio equipo, con las tareas problemáticas arregladas y cada competidor reevaluado en el benchmark refinado. Ese detalle importa cuando la brecha con GPT-5.6 Sol es de solo 3.1 puntos.
Un modelo de 2.4T que activa 95 mil millones de parámetros por token
El sufijo A95B es el número que importa para cualquiera que lo aloje. El diseño de mezcla de expertos activa 95 mil millones de los 2.4 billones de parámetros por token, y ese recuento activo es lo que rastrea el costo de servir el modelo. También es lo que hace que un modelo de este tamaño sea práctico fuera de un laboratorio; la mayoría de los parámetros permanecen inactivos. El linaje de Qwen 3.5 aporta Gated Delta Networks junto con MoE disperso, lo que el equipo atribuye a una inferencia de alto rendimiento con una sobrecarga de latencia mínima. La longitud de contexto alcanza 1 millón de tokens, con presupuestos de salida recomendados de 262,144 tokens de razonamiento y 131,072 tokens finales. El mismo lanzamiento incluye un hermano de 27 mil millones de parámetros, Qwen3.8-27B, unas 90 veces más pequeño.
La presión por la eficiencia recae en los motores de servicio. El equipo señala a SGLang, vLLM o TokenSpeed para cargas de trabajo de producción, el mismo territorio que apunta el trabajo reciente de Aleph Alpha: su biblioteca megakernel reportó ganancias de velocidad de inferencia de hasta el 200% para modelos MoE FP8 que se ejecutan en vLLM y SGLang. Con pesos tan grandes ahora abiertos, la eficiencia de inferencia, no el número de parámetros, decide quién puede usar realmente el modelo.
La advertencia sobre el harness detrás de las ganancias en agentes
Los saltos en capacidades de agentes son el titular: DeepSWE 1.1 sube de 21.6 a 56.6 frente a Qwen 3.7-Max, OSWorld-Verified de 73.3 a 86.1, y la tasa de aprobación del Agents' Last Exam de 11.8 a 27.0. Las notas a pie de página merecen tanta atención como las puntuaciones. En muchas filas, las ejecuciones de Qwen usan el harness de Claude Code; los competidores reciben sus harness oficiales (GPT-5.6 Sol con Codex, modelos Claude con puntuaciones de Terminus 2 de Artificial Analysis), y varios benchmarks son internos: QwenSWEBench, QwenQoderBench, CoWorkBench y otros. Para SkillsBench, el equipo declara sin rodeos que todos los resultados provienen de sus propias pruebas. Las cifras de Fable 5 "pueden implicar mecanismos de respaldo".
Esa divulgación es inusualmente franca, pero sigue siendo una evaluación realizada por el propio proveedor contra rivales cerrados, en benchmarks que el proveedor controla parcialmente. La brecha entre la programación en benchmarks y la producción no es nueva: los mejores modelos superan el 96% en SWE-bench Verified, pero apenas alcanzan el 23% en código empresarial privado, como mostró nuestra cobertura de las variantes Pro. La investigación que cubrimos sobre la evolución de los harness, probada en Terminal-Bench 2.1 con GPT-5.4 y Claude Opus 4.6, pregunta si las mejoras halladas mediante iteración del harness sobreviven en tareas reservadas. La misma pregunta se cierne sobre la estrecha ventaja de Qwen en SWE-bench Pro.
Qué pueden ejecutar realmente los desarrolladores con pesos abiertos
Se publican dos ID de modelo: Qwen/Qwen3.8-2.4T-A95B y Qwen3.8-27B, con descargas desde Hugging Face o ModelScope. Los usuarios bloqueados de Hugging Face pueden cambiar mediante variables de entorno como SGLANG_USE_MODELSCOPE o VLLM_USE_MODELSCOPE. La capa de despliegue se ha puesto al día: Hugging Face rediseñó sus Inference Endpoints en torno a vLLM, SGLang, llama.cpp y contenedores personalizados con autoescalado, lo que ofrece a un MoE con 95B activos una ruta de alojamiento estándar sin una pila a medida.
El lanzamiento amplía la estrategia de catálogo de Qwen. Su presencia en Hugging Face abarca siete dominios de capacidad, desde lenguaje hasta voz, imagen, razonamiento de agentes y alineación de seguridad, y la familia sigue creciendo con lanzamientos discretos fuera del escenario principal. El equipo acostumbra a publicar datos de entrenamiento, harness de evaluación y modelos de recompensa junto con los pesos. Abrir el código del modelo insignia cambia lo que vale esa costumbre: un modelo con las mejores puntuaciones en PaperBench, IFBench y OSWorld-Verified ahora viene con pesos, algo que sus rivales cerrados no han hecho.
La pregunta abierta es si las victorias sobreviven a la verificación de terceros. Las notas al pie muestran una franqueza real sobre los harness y las pruebas internas. Pero las filas en las que Qwen 3.8-Max supera a GPT-5.6 Sol fueron medidas por el equipo que entrenó el modelo, y la verificación independiente previa más sólida, Artificial Analysis sobre Qwen 3.7-Max, data de la generación anterior. Hasta que lleguen pruebas independientes, el mayor lanzamiento de pesos abiertos que Alibaba haya hecho descansa en cifras que registró en gran parte por sí mismo.
Lo esencial de la tecnología en 3 minutos cada mañana
Un correo, cada día laborable, con lo que realmente importa en IA y tecnología.