Los pesos abiertos de Qwen3.8-Max llegan la próxima semana
El modelo más potente de Alibaba hasta la fecha se vuelve de código abierto
Qwen3.8-Max, el primer modelo de clase Max con pesos abiertos de Alibaba, con 2,4 billones de parámetros, llega a Hugging Face y ModelScope la próxima semana. El lanzamiento replantea la cuestión del código abierto: ¿qué ocurre cuando los pesos más grandes de la frontera son libres de descargar y probar?
Emmanuel Fabrice Omgbwa Yasse Asistido por IA
2026-08-06 · 4 min de lectura

La línea de modelos más capaz de Alibaba solía ser la que no se podía tener. La serie Qwen-Max se creó para clientes de pago de la nube y permaneció cerrada incluso mientras los modelos Qwen de pesos abiertos más pequeños se extendían ampliamente. Esa barrera acaba de caer. Alibaba lanzó Qwen3.8-Max, al que la compañía califica como el modelo más capaz de su familia hasta la fecha, en una publicación en su blog de la nube. Con 2,4 billones de parámetros y construido sobre la arquitectura de Qwen 3.5, es el primer buque insignia de clase Max en ser de código abierto: los pesos llegan la próxima semana a Hugging Face y ModelScope.
La publicación del lanzamiento se basa en tres largas ejecuciones autónomas, cada una con un rastro público, en las que el modelo mejoró su propio trabajo durante días sin ayuda humana.
Pesos abiertos en la cima de la gama
Abrir el código de un buque insignia es una decisión que pocos laboratorios toman, porque mantener los mejores pesos detrás de una API de pago es la forma en que las empresas de IA de frontera protegen su margen. Alibaba acompaña el lanzamiento con un impulso de producto: la compañía ha abierto la beta de QwenWork, una plataforma de agentes para el lugar de trabajo que unifica escritorio, nube y el paquete de colaboración DingTalk, que sirve a más de 20 millones de empresas y organizaciones, en una única suscripción. Qwen3.8-Max es una opción de modelo destacada en QwenWork a partir del 3 de agosto, y los cuatro niveles de modelo de la plataforma van desde Economy hasta Flagship.
Para los desarrolladores, el nuevo modelo habla los dialectos de API de sus rivales. QwenCloud ofrece endpoints de completado de chat y respuestas compatibles con OpenAI, además de una interfaz compatible con Anthropic, por lo que Qwen3.8-Max puede ejecutarse dentro de Claude Code o Codex con un par de variables de entorno. Un parámetro reasoning_effort, con niveles xhigh, medium y low, controla cuánto piensa el modelo antes de responder, y preserve_thinking está activado de forma predeterminada.
Cuatro rondas que superaron al artículo
La evidencia más detallada es la ejecución de reproducción de investigación. Con un artículo llamado "Unified Data Selection for LLM Reasoning" y sin código inicial, Qwen3.8-Max dedicó unas 37 horas a reconstruir el pipeline desde cero, escribió unas 7.600 líneas de código, ejecutó 33 rondas de entrenamiento con GPU y reprodujo los seis hallazgos principales del artículo. Luego usó otras 88 horas para intentar mejorar, generando 18 ideas en cuatro rondas. La idea ganadora, que cuenta lo que el modelo denomina puntos de decisión difíciles en los ejemplos de entrenamiento, superó al método del propio artículo por 2,7 puntos en el benchmark matemático AIME24.
| Ronda | Mejor idea | AIME24 | Ganancia vs. línea base |
|---|---|---|---|
| Línea base | Método del artículo, reproducido | 49,58% | n/a |
| 1 | Dividir los datos por dificultad | 50,42% | +0,84 |
| 2 | Ponderar ejemplos por la brecha de puntuación de entropía | 51,67% | +2,09 |
| 3 | Ajustar la anchura de selección | 51,25% | +1,67 |
| 4 | Contar los puntos de decisión difíciles ("nhighgate") | 52,29% | +2,71 |
Las otras dos ejecuciones siguen el mismo patrón. Inscrito en el WWW2025 Multimodal Dialogue Intent Recognition Challenge en la plataforma Tianchi de Alibaba, el modelo afinó varios modelos de lenguaje, los fusionó en un sistema de votación ponderada y pasó de 0,60 a 0,853 de precisión en 45 envíos, terminando por delante de 458 de los 526 equipos humanos. En un ejercicio de diseño de chips, llevó un acelerador GCD/RSA de 8.298 compuertas a 678 compuertas en unas 500 iteraciones, y el diseño físico se redujo de 106×106 µm² a 46×46 µm². Una ejecución autónoma de 16 días en el proyecto oh-my-cli acumuló 265 commits, 127 PRs y 151 issues, todo visible en el repositorio público de GitHub.
La casa puntuando su propio juego
Nada de esto viene con un auditor independiente. Los resultados son propios de Alibaba, y los más llamativos se asientan en benchmarks diseñados por Alibaba. En E-Commerce Bench, una simulación de negocio de 365 días construida con datos de transacciones desensibilizados de Taobao y Tmall, Qwen3.8-Max convirtió ¥100.000 de capital inicial en un saldo de ¥416.252, un retorno de 4,16 veces que la compañía dice superar al segundo clasificado, GLM 5.2, en un 38%. Las comparaciones de harness contra Claude Code y Codex provienen del mismo blog. Nada de eso hace que los resultados sean falsos. Significa que la carga de la verificación recae sobre todos los demás.
Los pesos abiertos resuelven parte de ese problema. Una vez que lleguen la próxima semana, cualquiera con suficientes GPU podrá volver a ejecutar los benchmarks en disputa y comprobar si el modelo se sostiene fuera del andamiaje propio de Alibaba. Los laboratorios de frontera mantienen sus pesos más grandes detrás de APIs de pago; Alibaba acaba de regalar su mejor modelo. El veredicto sobre Qwen3.8-Max vendrá de la comunidad de código abierto, no de una publicación de lanzamiento.
Lo esencial de la tecnología en 3 minutos cada mañana
Un correo, cada día laborable, con lo que realmente importa en IA y tecnología.