SevenTnewS

IA de código abierto

Qwen3.8-Max superó a 458 equipos humanos en 24 horas, trabajando solo

Qwen3.8-Max superó a 458 de 526 equipos humanos en un concurso de 24 horas mientras trabajaba solo, y Alibaba publicará sus pesos como código abierto la próxima semana. Por ahora, todas las cifras son autodeclaradas, lo cual es exactamente por lo que las afirmaciones de autonomía merecen ser examinadas.

Emmanuel Fabrice Omgbwa Yasse Asistido por IA

2026-08-03 · 5 min de lectura

Qwen3.8-Max superó a 458 equipos humanos en 24 horas, trabajando solo
Fuentes : Qwen3.8-Max: A …·Seventnews inte…

El equipo Qwen de Alibaba lanzó Qwen3.8-Max el 2 de agosto, un modelo de 2,4 billones de parámetros que considera el más capaz de la familia. Los pesos abiertos, una primicia para un modelo de la clase Max, estarán disponibles la próxima semana. Pero la noticia real del lanzamiento es un conjunto de afirmaciones sobre lo que el modelo hizo sin que ningún humano lo supervisara: mantener un proyecto de software en funcionamiento durante más de diez días, reproducir un artículo de investigación desde cero y luego superarlo, y terminar por delante de la mayoría de un campo de 526 equipos humanos.

Estas afirmaciones pesan más que la tabla de benchmarks habitual, porque describen trabajo autónomo sostenido, el tipo de trabajo que decide si los modelos actuales son realmente útiles fuera de una demostración. También son, por ahora, enteramente autodeclaradas. La empresa no oculta que son sus propias pruebas; la verificación independiente aún no se ha puesto al día. Tenga en cuenta esa tensión en lo que sigue.

Tres ejecuciones sin supervisión

Qwen planteó al modelo tres desafíos, cada uno de varios días de duración y cada uno con uso de herramientas, autocorrección y replanificación. Las reglas eran similares en los tres: el modelo comenzaba sin código y sin dirección humana, y cada resultado debía lograrse escribiendo y ejecutando software.

TareaDuraciónResultado, según Qwen
Construir el proyecto oh-my-cli y un banco de pruebas autoevolutivoEjecución de más de 10 días265 commits, 127 PRs, 151 issues después de aproximadamente 16 días autónomos
Reproducir un artículo de investigación y luego mejorarloAlrededor de 125 horas7.600 líneas de código, 33 rondas de entrenamiento con GPU, +2,7 puntos por encima del método del artículo en AIME24
Competir en un concurso en vivo contra 526 equipos humanos24 horas458 equipos superados (87 %), precisión de 0,60 a 0,853

El caso del concurso es el que hay que leer dos veces. El modelo leyó las reglas de la competición, eligió modelos para ajustar (BERT, MacBERT y RoBERTa para texto, Qwen2.5-VL-7B para capturas de pantalla) y los fusionó en un sistema de votación ponderada. Cada una de sus 45 presentaciones orientó la siguiente ronda de entrenamiento, elevando la precisión de 0,60 a 0,853 y superando a 458 de los 526 equipos humanos, el 87 por ciento del campo. El patrón que la empresa está vendiendo no es una única ejecución inteligente. Es un bucle que se mejora a sí mismo.

Los pesos abiertos cambian lo que está en juego

Hasta ahora, el nivel Max era la parte cerrada de la línea de Qwen. Qwen3.8-Max rompe ese molde: el equipo dice que los pesos se publicarán en Hugging Face y ModelScope la próxima semana, el primer lanzamiento de pesos abiertos de la clase Qwen-Max. Con 95 mil millones de parámetros activos de un total de 2,4 billones, la etiqueta de código abierto ahora se extiende a un modelo diseñado para ejecuciones de agentes de varios días, no solo para chat.

La medida encaja en la estrategia más amplia de Alibaba. La empresa consolidó su trabajo de IA en una única unidad de negocio con la misión, en sus propias palabras, de "crear, entregar y aplicar tokens", respaldada por una inversión de 53 mil millones de dólares, y ha estado lanzando una flota de modelos en lugar de un único campeón. Qwen3.7-Max, lanzado en mayo, era el buque insignia anterior; las pruebas comparativas independientes de Artificial Analysis mostraron que superaba a los principales competidores chinos e igualaba a los mejores sistemas globales. Qwen3.8-Max es el siguiente paso en ese camino, con los pesos abiertos como factor diferenciador.

El problema de la autodeclaración

La advertencia honesta: casi todas las cifras del comunicado proceden del equipo que construyó el modelo. Algunas filas de benchmarks de modelos rivales están en blanco donde no existe una puntuación publicada, y los entornos de prueba utilizados no siempre son idénticos de una fila a otra. En la tabla destacada del propio comunicado, los resultados más fuertes de Qwen3.8-Max frente a los rivales de frontera mencionados son 93,0 en PaperBench, por encima de la puntuación de 90,5 del GPT-5.6 Sol, y 92,9 en la variante de 8 agujas de MRCR v2 con contexto de 256K. Son cifras del proveedor, pero son cifras precisas del proveedor.

Las ejecuciones más largas son las más difíciles de verificar y las más llamativas. Dado un espacio de trabajo inicial y un script de evaluación, el modelo rediseñó un acelerador criptográfico en unos 500 turnos, reduciendo el número de puertas sintetizadas de 8.298 a 678 y el dado colocado de 106 por 106 micrómetros a 46 por 46, una reducción del 81 por ciento en el área, mientras lograba el cierre de tiempos a 500 MHz. Los hitos publicados se leen como el registro de un ingeniero: reemplazar el divisor de módulo, recortar los anchos de bits, podar la máquina de estados, fusionar módulos, exprimir puertas. En un benchmark simulado de comercio electrónico de 365 días basado en datos de transacciones de Taobao y Tmall, terminó con un saldo de 416.252 yenes, un 38 por ciento por delante del subcampeón.

Una ejecución de terceros de una sesión autónoma de diez días, con el registro completo publicado, es lo que zanjaría esta clase de afirmaciones. El equipo de Qwen ha hecho algo casi tan bueno en un caso: el historial completo del proyecto para la construcción de oh-my-cli es público en GitHub, por lo que todos los commits, pull requests e issues se pueden comprobar.

Qué incluye

En el lado de la API, Qwen3.8-Max admite un parámetro reasoning_effort con tres niveles (xhigh, medium, low) y conserva la salida de pensamiento por defecto. Se integra con Claude Code, Codex, Qoder, Qwen Code y OpenClaw a través de endpoints compatibles con OpenAI y compatibles con Anthropic. Una nueva librería, Qwen-MM-Plugins, añade procesamiento de imágenes y vídeo a los frameworks de agentes existentes, y el equipo presentó RecreationBench, un benchmark para reconstruir aplicaciones reales observadas solo como cajas negras en cinco plataformas.

La pregunta para el próximo mes es si la autonomía se mantiene fuera de los sandboxes del propio Qwen. Los laboratorios independientes son quienes responderán a esa pregunta. Mientras tanto, el lanzamiento es significativo por una razón más simple: Alibaba apuesta a que los pesos abiertos, no solo el acceso por API, son lo que se necesita para poner agentes autónomos de varios días ante el mundo.

Lo esencial de la tecnología en 3 minutos cada mañana

Un correo, cada día laborable, con lo que realmente importa en IA y tecnología.