SevenTnewS

IA de documentos

Por qué el mejor analizador de documentos ahora cabe en 800 millones de parámetros

El OvisOCR2 de Alibaba, un modelo compacto extremo a extremo de 0.8B, alcanza puntuaciones de última generación en OmniDocBench (96.58) y PureDocBench (75.06), superando a analizadores más grandes basados en pipelines. Su éxito proviene de un motor de datos que mezcla documentos reales filtrados con páginas sintéticas, aprendizaje por refuerzo sobre un profesor de 4B y destilación on-policy en el modelo pequeño.

Emmanuel Fabrice Omgbwa Yasse Asistido por IA

2026-07-24 · 4 min de lectura

Por qué el mejor analizador de documentos ahora cabe en 800 millones de parámetros
Fuentes : OvisOCR2 Techni…

El análisis de documentos ha sido durante mucho tiempo un proceso de dos etapas. Primero, un modelo de análisis de diseño divide la página en regiones, bloques de texto, tablas, fórmulas, figuras; luego, un modelo de reconocimiento lee cada recorte. El enfoque es robusto pero engorroso: los errores en la primera etapa se propagan a la segunda, y desplegar dos modelos con diferentes perfiles de ejecución añade complejidad operativa.

Los modelos extremo a extremo, que generan una representación en Markdown directamente desde la imagen de la página, siempre han parecido más limpios sobre el papel. Pero en la práctica se quedaban atrás, incapaces de igualar a los sistemas modulares que dominan los benchmarks públicos como OmniDocBench. Esa brecha acaba de cerrarse, con un modelo de 0.8 mil millones de parámetros, nada menos.

OvisOCR2, desarrollado por el equipo ATH-MaaS de Alibaba, entrena a Qwen3.5-0.8B, el miembro más pequeño de la familia Qwen3.5, como un analizador de páginas dedicado. En OmniDocBench v1.6, obtiene 96.58 en general, superando a todos los métodos de pipeline, incluidos PaddleOCR-VL-1.6 (96.33), GLM-OCR (95.22) y MinerU2.5-Pro (95.75). En PureDocBench, su puntuación Avg3 de 75.06 también encabeza el ranking.

Cómo un modelo diminuto vence a los grandes

La principal innovación radica en la receta de entrenamiento, no en la arquitectura. El equipo construyó un motor de datos con dos pipelines complementarios.

El pipeline del mundo real toma imágenes de documentos reales, las procesa con PaddleOCR-VL-1.5 o MinerU2.5-Pro, analiza la salida JSON estructurada, la normaliza a un esquema unificado de Markdown y filtra los resultados mediante comprobaciones basadas en reglas y verificaciones manuales. Esto asegura que cuando el modelo ve facturas escaneadas o artículos académicos, la supervisión sea lo más limpia posible.

El pipeline sintético parte de muestras difíciles, páginas que el modelo inicialmente fallaba. Un modelo multimodal las convierte en plantillas HTML, que luego son diversificadas por un agente que varía tanto el contenido como la estructura. La idea clave: como la fuente HTML renderiza tanto la imagen como la verdad de suelo en Markdown, no hay ruido de anotación. El modelo aprende de etiquetas perfectas, lo cual es especialmente valioso para tablas, fórmulas y diseños de formato largo.

Aprendizaje por refuerzo para salidas estructuradas

El entrenamiento procede en etapas. Primero, ajuste fino supervisado sobre Qwen3.5-0.8B establece la política base de análisis. Luego, una rama de 4B se somete a aprendizaje por refuerzo (GRPO) con una recompensa de múltiples componentes: distancia de edición normalizada para texto, coincidencia de detección de caracteres (CDM) para fórmulas y distancia de edición de árbol (TEDS) para tablas. La recompensa promedia solo los componentes presentes en la verdad de suelo de cada página, evitando ruido de métricas irrelevantes.

Aplicar RL directamente al modelo de 0.8B causó calidad inestable en las tablas. Por lo tanto, el equipo usó el modelo de 4B potenciado con RL como profesor para destilación on-policy (OPD). El estudiante genera salidas, el profesor las puntúa, y el estudiante aprende mediante divergencia KL inversa, sesgada hacia los tokens más seguros del profesor. Un truco de top-k reduce el tensor por posición del tamaño del vocabulario a k, manteniendo la memoria manejable para respuestas largas.

Finalmente, varias variantes candidatas se fusionan mediante promediado ponderado de parámetros.

Resultados de benchmarks en contexto

Punto de referenciaOvisOCR2Mejor pipeline (SOTA anterior)Mejor extremo a extremo (anterior)
OmniDocBench v1.6 (general)96.5896.33 (PaddleOCR-VL-1.6)94.74 (HunyuanOCR-1.5)
PureDocBench (Avg3)75.0670.39 (DotsMOCR, pipeline)73.92 (FD-RL, extremo a extremo)
Distancia de edición de texto (OmniDocBench)0.0250.033 (PaddleOCR-VL-1.6)0.039 (HunyuanOCR-1.5)
CDM de fórmulas (OmniDocBench)97.5397.49 (PaddleOCR-VL-1.6)95.79 (Unlimited-OCR)

Las mejoras son consistentes en las cuatro dimensiones de evaluación, texto, fórmulas, tablas y orden de lectura, no solo en el promedio general. En OmniDocBench, OvisOCR2 reporta la distancia de edición de texto más baja, el CDM de fórmulas más alto, el TEDS-S de tablas más alto y la distancia de edición de orden de lectura más baja entre todos los modelos especializados.

Qué significa esto para el campo

El espacio de análisis de documentos se ha estado moviendo hacia modelos unificados desde hace tiempo. Mistral's OCR 4 añadió cuadros delimitadores y clasificación de bloques tipificados dentro de un solo contenedor. DeepSeek-OCR 2 introdujo Visual Causal Flow y publicó sus pesos como código abierto. Ambos son extremo a extremo en espíritu, pero aún dependen de algunos componentes modulares.

OvisOCR2 va más allá: un único modelo de 0.8B que genera Markdown directamente, sin un analizador de diseño acoplado. La contrapartida es la robustez en el mundo real: en la pista Real de PureDocBench (páginas capturadas con teléfono, fotocopias, fotografías de pantalla), OvisOCR2 obtiene 66.56, por debajo de Gemini-3.1-Pro y Qwen3.5-122B-A10B. El equipo reconoce que la calidad de imagen degradada sigue siendo un punto débil.

Aún así, el rendimiento del modelo en escritura a mano y tablas complejas, dos puntos débiles para los métodos de pipeline, es notablemente sólido. En un subconjunto interno de escritura a mano, OvisOCR2 logra una puntuación general de 72.28 frente a 69.58 de GLM-OCR. En tablas complejas, su tasa de omisión (tablas completamente ausentes en la salida) baja al 7.96%, en comparación con el 13-17% de los analizadores de pipeline. Una vez que el análisis de diseño de un pipeline omite una tabla, ningún reconocedor posterior puede recuperarla.

El modelo está disponible en HuggingFace. Con 0.8B parámetros, puede ejecutarse en GPUs de consumo o incluso en CPU con optimizaciones, haciendo accesible el análisis de documentos de alta calidad más allá de las empresas con buenos recursos.

Lo esencial de la tecnología en 3 minutos cada mañana

Un correo, cada día laborable, con lo que realmente importa en IA y tecnología.