SevenTnewS

Eficiencia de IA

Cuatro modelos pequeños acaban de vencer a sus hermanos mayores. Eso ya no es una coincidencia

OvisOCR2 (0.8B), Mage-Flow (4B), Celeris-1 y una victoria rentable de Claude Opus 5 sobre Fable 5 superaron este mes a sistemas más grandes o costosos, no mediante escala sino solucionando el cuello de botella específico (tokenización, redundancia de pipeline, latencia) que realmente limitaba el rendimiento.

Emmanuel Fabrice Omgbwa Yasse

2026-07-30 · 2 min de lectura

Cuatro modelos pequeños acaban de vencer a sus hermanos mayores. Eso ya no es una coincidencia
Fuentes : Analysis synthe…

OvisOCR2, un modelo de 800 millones de parámetros de Tencent, obtuvo una puntuación de 96.58 en OmniDocBench, el primer modelo de extremo a extremo en encabezar esa tabla de clasificación. Los sistemas de pipeline de múltiples etapas, que encadenan modelos separados de detección, diseño y reconocimiento, han dominado el análisis de documentos durante años, bajo la suposición de que dividir el problema en etapas era la única forma de alcanzar la máxima precisión. Que un solo modelo pequeño supere esa arquitectura directamente, usando aprendizaje por refuerzo y destilación en lugar de más parámetros, es el tipo de resultado que debería hacer que todo equipo que mantiene un sistema de pipeline se pregunte si la complejidad sigue aportando algo.

Ese no es un resultado aislado este mes. Mage-Flow de Microsoft, un modelo de generación y edición de imágenes de 4 mil millones de parámetros, iguala a sistemas más grandes de 30 mil millones de parámetros como Qwen-Image y FLUX.2, mientras funciona en una sola GPU A100. Su innovación clave no es una red más grande, sino un tokenizador ligero que reduce los costos de codificación en 12 veces. Celeris-1 obtiene un 75.9% en MMLU-Pro con 158 milisegundos de latencia, ocho veces más rápido que GPT-5 mini, perdiendo solo 2.6 puntos de precisión, un intercambio que la mayoría de los despliegues en producción aceptarían sin dudar. Y en una comparación más específica pero contundente, Claude Opus 5 superó las tres tareas en un punto de referencia de física interactiva con el costo más bajo entre los mejores rendimientos, mientras que Claude Fable 5 falló cada una de ellas al doble de precio.

Lo que estos cuatro tienen en común

Ninguno de estos resultados provino de un único truco arquitectónico que casualmente se generalice. OvisOCR2 se apoya en destilación y RL. Mage-Flow se apoya en la eficiencia del tokenizador. Celeris-1 se apoya en la velocidad de inferencia como objetivo de diseño de primera clase, no como una ocurrencia tardía. El resultado de Opus 5 se trata realmente de la calidad del entrenamiento y la alineación en un tipo de tarea específica, no del tamaño en absoluto. Lo que los conecta es que cada equipo dejó de tratar el recuento de parámetros como la palanca predeterminada y, en su lugar, encontró el cuello de botella real en su problema específico (sobrecarga de tokenización, redundancia de pipeline, latencia de inferencia, razonamiento específico de la tarea) y lo reparó directamente.

Esa es una postura de I+D significativamente diferente a la que dominó el desarrollo de la IA aproximadamente de 2020 a 2024, cuando las leyes de escalado hicieron que "entrenar un modelo más grande" fuera una forma confiable, aunque costosa, de obtener ganancias de capacidad. Esas leyes no han sido derogadas. Pero el rendimiento marginal de la escala pura se ha vuelto más difícil de aprovechar, mientras que el rendimiento marginal de la eficiencia arquitectónica (mejores tokenizadores, mejores recetas de destilación, mejor enrutamiento) se ha vuelto más fácil de encontrar, precisamente porque menos equipos han estado buscando allí.

Por qué esto es una historia más grande que cuatro lanzamientos de productos

La consecuencia práctica es que "el modelo más grande disponible" ya no es una respuesta segura por defecto a "qué modelo deberíamos usar", ni siquiera para equipos sin restricciones presupuestarias. Un modelo de imágenes de 30 mil millones de parámetros que es igualado por un modelo de 4 mil millones de parámetros en una GPU de acceso común para consumidores no solo es más barato, sino que es una señal de que la capacidad extra del modelo más grande no se estaba utilizando eficientemente en primer lugar. Cada uno de estos cuatro resultados es una pequeña victoria de ingeniería específica. Juntos, son evidencia de que las ganancias más fáciles que quedan en el campo provienen cada vez más de preguntarse qué está desperdiciando un modelo, no de preguntarse cuánto más grande podría ser.

Lo esencial de la tecnología en 3 minutos cada mañana

Un correo, cada día laborable, con lo que realmente importa en IA y tecnología.