SevenTnewS

Modelos de IA

El diseño de cuatro especialistas de Macaron-V1-Venti con 748B supera a GPT-5.5 y Opus 4.8

Macaron-V1-Venti de MindLab Research lidera las evaluaciones en inteligencia personal, codificación, uso de terminal e IU Generativa, utilizando una novedosa arquitectura Mixture of LoRA que mantiene el modelo compacto a la vez que especializado.

Emmanuel Fabrice Omgbwa Yasse Asistido por IA

2026-07-27 · 3 min de lectura

El diseño de cuatro especialistas de Macaron-V1-Venti con 748B supera a GPT-5.5 y Opus 4.8
Fuentes : Macaron-V1-Vent…

MindLab Research ha lanzado Macaron-V1-Venti, un modelo de 748 mil millones de parámetros que ocupa el primer lugar en un conjunto de pruebas de referencia que cubren inteligencia personal, programación, flujos de trabajo en terminal y UI Generativa. El modelo, publicado bajo la licencia MIT, es el primero en ser post-entrenado en GLM-5.2 y utiliza una arquitectura Mixture of LoRA (MoL) que divide la experiencia en cuatro módulos especializados en lugar de depender de una única red densa, haciendo eco de un enfoque similar de múltiples especialistas.

Cuatro especialistas en lugar de uno

El diseño MoL combina un modelo base GLM-5.2 de 744B parámetros con cuatro adaptadores LoRA de 1B parámetros, cada uno responsable de un dominio: chat, agente, codificación y GenUI. Un enrutador selecciona el especialista adecuado para cada solicitud entrante. Esto mantiene un recuento de parámetros activos compacto mientras accede a conocimiento especializado profundo. El enfoque difiere de los diseños típicos de mezcla de expertos al usar adaptadores LoRA, que son más baratos de entrenar e intercambiar, y destaca el costo real del enrutamiento de modelos.

Macaron-V1-Venti sucede al anterior Macaron-V1-Preview y amplía el entrenamiento en tareas de agente personal y UI Generativa. El pipeline de post-entrenamiento utiliza los sistemas MinT y MindForge de MindLab, diseñados para alinear el modelo con el arnés de producción utilizado para flujos de trabajo agentivos. El modelo admite una longitud de contexto de 1 millón de tokens, habilitada por una infraestructura de entrenamiento de contexto largo llamada LongStraw que maneja ejecuciones de aprendizaje por refuerzo de millones de tokens.

Líder en todas las pruebas de referencia

Los resultados reportados muestran a Macaron-V1-Venti liderando o empatando en siete de diez pruebas comparado con GLM 5.2, GPT 5.5, Claude Opus 4.8, Gemini 3.1 Pro, Qwen 3.7 Max y Minimax M3. En ChatBench, obtiene 58.3 frente a 55.5 de GPT 5.5 y 52.8 de Claude Opus 4.8. En LivingBench, que mide tareas agentivas del mundo real, alcanza 64.0, superando a Claude Opus 4.8 con 63.8 y GPT 5.5 con 61.9. El modelo se desempeña fuertemente en pruebas de codificación: logra 85.6 en SWE Verified, solo superado por Claude Opus 4.8 con 88.6, y lidera TerminalBench 2.1 con 87.6, muy por delante de GPT 5.5 con 83.4 y Claude con 78.9, con el posicionamiento de Claude Opus 5 en pruebas de referencia ofreciendo contraste.

La mayor brecha aparece en UI4ABench, donde Macaron-V1-Venti obtiene 87.8, muy por encima de GPT 5.5 con 72.1 y Claude Opus 4.8 con 75.9. Esa prueba evalúa UI Generativa, la capacidad del modelo para generar interfaces de usuario a partir de instrucciones en lenguaje natural. El módulo especializado para GenUI parece darle una clara ventaja allí. En PinchBench, que mide capacidades de uso de herramientas, Macaron-V1-Venti obtiene 94.0, superando a Qwen 3.7 Max con 93.4 y Claude Opus 4.8 con 91.8.

En ClawGym, que mide el rendimiento general de agentes, Macaron obtiene 77.7, detrás de GPT 5.5 con 82.5 y Claude Opus 4.8 con 80.5. Y en DeepSWE, una prueba de ingeniería de software más desafiante, obtiene 58.4, detrás de GPT 5.5 con 70.0, lo que sugiere que, aunque su especialista en codificación sobresale en tareas estándar, las correcciones complejas de múltiples pasos siguen siendo una debilidad, un patrón también visto en agentes que chocan con muros de creatividad.

Lo que dicen los números sobre el enfoque

La fortaleza de la arquitectura MoL se muestra más claramente en pruebas especializadas. El especialista en codificación impulsa a Macaron por delante de GPT 5.5 en SWE Verified y TerminalBench, y el especialista en GenUI crea una gran brecha en UI4ABench. Pero en pruebas más generales como ClawGym, que pueden requerir cambio dinámico o razonamiento multi-dominio, el modelo se queda atrás. El enrutador L0 decide de antemano, y cuando una solicitud necesita conocimiento de múltiples especialistas, el diseño actual no los fusiona durante una sola interacción.

MindLab reconoce implícitamente esta limitación: la tarjeta del modelo señala que el razonamiento en curso y las interacciones con herramientas permanecen dentro del LoRA seleccionado, mientras que el trabajo completado puede compartirse entre especialistas a través de resúmenes concisos. Eso sugiere que la colaboración es posible, pero no en tiempo real para una sola interacción.

Código abierto y disponibilidad

El modelo se publica bajo la licencia MIT, un movimiento alineado con el caso de los pesos abiertos, aunque la tarjeta del modelo advierte a los usuarios que respeten cualquier requisito heredado de GLM-5.2 y sus dependencias. Macaron-V1-Venti está disponible en Hugging Face y se puede acceder a través de una API alojada en mintcn.macaron.xin, que admite finalizaciones de chat compatibles con OpenAI. Para implementación auto-alojada, MindLab proporciona un arnés de servicio de Mixture of LoRA que mantiene el endpoint compatible con OpenAI mientras agrega el enrutador y los metadatos del lado del servidor de LoRA.

Una herramienta complementaria llamada Macaron Artifacts permite a los usuarios ver las UI y sesiones generadas, y se puede instalar como un complemento en Claude Code, Codex y Kimi Code.

Lo esencial de la tecnología en 3 minutos cada mañana

Un correo, cada día laborable, con lo que realmente importa en IA y tecnología.