Análisis
El modelo de 0.8B que desafió todo sobre el análisis de documentos
OvisOCR2, un analizador de documentos de 0.8B parámetros de Tencent, logró 96.58 en OmniDocBench, el primer modelo end-to-end en encabezar la tabla de clasificación. El modelo utiliza aprendizaje por refuerzo y destilación para superar a sistemas basados en pipelines más grandes, desafiando las suposiciones sobre la necesidad de arquitecturas de múltiples etapas.
Emmanuel Fabrice Omgbwa Yasse Asistido por IA
2026-07-26 · 3 min de lectura

El análisis de documentos ha estado dominado durante mucho tiempo por los sistemas de pipeline. Estas cadenas de módulos especializados, detector de texto, reconocedor, analizador de diseño, analizador de fórmulas, cada uno añade complejidad y el riesgo de que los errores se propaguen aguas abajo. La sabiduría convencional sostenía que ningún modelo único end-to-end podía igualar su precisión, especialmente en páginas reales desordenadas.
OvisOCR2 de Tencent pone en duda esa sabiduría. Con solo 0.8 mil millones de parámetros, el modelo obtuvo 96.58 en la tabla de clasificación de OmniDocBench v1.6, la mejor calificación general para cualquier método, pipeline o end-to-end. El informe técnico publicado el 15 de julio en arXiv detalla cómo llegó el equipo.

La receta de entrenamiento es la verdadera historia. El equipo construyó un motor de datos que mezcla anotaciones de documentos reales filtradas con páginas sintéticas donde tanto la imagen como el objetivo Markdown provienen de la misma fuente HTML, garantizando una alineación perfecta. Después del ajuste fino supervisado, entrenaron una rama de 4 mil millones de parámetros utilizando aprendizaje por refuerzo con una recompensa de múltiples componentes que califica precisión, estructura y formato. Luego destilaron ese conocimiento en el modelo de 0.8B mediante destilación on-policy y fusionaron pesos de múltiples puntos de control. El resultado: un modelo end-to-end que supera a métodos que a menudo usan cinco veces más parámetros y módulos separados.
Esto importa más allá de un solo punto de referencia. En PureDocBench, OvisOCR2 obtuvo 75.06, el Avg3 más alto entre los métodos comparados. Un punto de referencia interno que cubre diseños más diversos y desafiantes también mostró que el modelo mantiene su ventaja, lo que sugiere que el enfoque se generaliza más allá de los conjuntos de pruebas seleccionados.
El campo se ha estado moviendo hacia diseños end-to-end. DeepSeek-OCR 2 y Mistral OCR 4 ambos ofrecen análisis de documentos de código abierto, pero ninguno ha reclamado el primer lugar en OmniDocBench con un modelo end-to-end a esta escala. DeepSeek-OCR 2 utiliza resolución dinámica y tokens visuales, mientras que Mistral OCR 4 añade cuadros delimitadores y puntuaciones de confianza por palabra, ambos inclinándose hacia una estructura similar a pipeline. OvisOCR2 es puramente end-to-end: imagen de página de entrada, Markdown de salida, sin cuadros o etapas intermedias.
Las implicaciones prácticas son claras. Para los desarrolladores que construyen flujos de trabajo de documentos, un solo modelo de 0.8B que maneja texto, tablas, fórmulas y diseño en una sola pasada simplifica la infraestructura y reduce la latencia. También reduce la barrera para ejecutarse en dispositivos periféricos o en entornos de bajos recursos.
Quedan preguntas abiertas. El artículo no especifica el costo computacional de entrenamiento, la velocidad de inferencia ni la composición exacta de los datos sintéticos. El modelo está disponible en GitHub, pero el enlace al repositorio no está completamente expandido en el preprint. La reproducción independiente y los puntos de referencia de latencia dirán si la puntuación de 96.58 se traduce en rendimiento en el mundo real.
Independientemente, el resultado de OvisOCR2 es un hito. Demuestra que con suficiente calidad de datos y un pipeline de entrenamiento inteligente, los modelos pequeños de extremo a extremo pueden competir y ganar contra sistemas modulares que han tenido años de ventaja en optimización. La carga ahora recae en el campo del pipeline para justificar su complejidad.
- Fuente : OvisOCR2 Technical Report
Lo esencial de la tecnología en 3 minutos cada mañana
Un correo, cada día laborable, con lo que realmente importa en IA y tecnología.