IA documentaire
Le modèle 0,8B qui a battu tous les analyseurs de documents pipeline sur leur propre terrain
L'OvisOCR2 d'Alibaba, un modèle compact de bout en bout de 0,8B, atteint des scores de pointe sur OmniDocBench (96,58) et PureDocBench (75,06), dépassant les analyseurs pipeline plus grands. Son succès vient d'un moteur de données mélangeant des documents réels filtrés et des pages synthétiques, d'un apprentissage par renforcement sur un enseignant 4B et d'une distillation on-policy dans le petit modèle.
Emmanuel Fabrice Omgbwa Yasse Assisté par IA
2026-07-24 · 4 min de lecture

L'analyse de documents a toujours signifié l'empilement de deux étapes : d'abord un modèle d'analyse de mise en page divise la page en régions, blocs de texte, tableaux, formules, figures, puis un modèle de reconnaissance lit chaque extrait. Cette approche fonctionne mais elle est fragile. Les erreurs de la première étape se répercutent sur la seconde, et le déploiement de deux modèles aux profils d'exécution différents ajoute de la complexité opérationnelle.
Les modèles de bout en bout, qui génèrent une représentation Markdown directement à partir de l'image de la page, ont toujours semblé plus propres sur le papier. Mais en pratique, ils étaient à la traîne des systèmes modulaires qui dominent les benchmarks publics comme OmniDocBench. Cet écart vient de se combler, et avec un modèle de 0,8 milliard de paramètres, rien de moins. La transition plus large vers un analyseur unifié s'est accélérée, comme le montrent les propres benchmarks OCR de Mistral.
OvisOCR2, développé par l'équipe ATH-MaaS d'Alibaba, post-entraîne Qwen3.5-0.8B, le plus petit membre de la famille Qwen3.5, en un analyseur de page dédié. Sur OmniDocBench v1.6, il obtient un score global de 96,58, devançant toutes les méthodes pipeline, y compris PaddleOCR-VL-1.6 (96,33), GLM-OCR (95,22) et MinerU2.5-Pro (95,75). Sur PureDocBench, son score Avg3 de 75,06 est également en tête du classement.
Comment un petit modèle bat les grands
La principale innovation réside dans la recette d'entraînement, pas dans l'architecture. L'équipe a construit un moteur de données avec deux pipelines complémentaires.
Le pipeline réel prend des images de documents réels, les fait passer par PaddleOCR-VL-1.5 ou MinerU2.5-Pro, analyse la sortie JSON structurée, la normalise en un schéma Markdown unifié, et filtre les résultats via des vérifications basées sur des règles et des contrôles ponctuels manuels. Cela garantit que lorsque le modèle voit des factures scannées ou des articles académiques, la supervision est aussi propre que possible.
Le pipeline synthétique part d'échantillons difficiles, des pages que le modèle a initialement mal traitées. Un modèle multimodal les convertit en templates HTML, qui sont ensuite diversifiés par un agent qui fait varier à la fois le contenu et la structure. L'idée clé : comme la source HTML rend à la fois l'image et la vérité terrain Markdown, il n'y a aucun bruit d'annotation. Le modèle apprend à partir d'étiquettes parfaites, particulièrement précieuses pour les tableaux, les formules et les mises en page longues. Ce type de génération de données synthétiques est une technique éprouvée, comme on le voit dans le pipeline de génération d'images basé sur RL de Qwen.
Apprentissage par renforcement pour des sorties structurées
L'entraînement se déroule par étapes. D'abord, un fine-tuning supervisé sur Qwen3.5-0.8B établit la politique de base d'analyse. Ensuite, une branche 4B subit un apprentissage par renforcement (GRPO) avec une récompense multi-composants : distance d'édition normalisée pour le texte, correspondance de détection de caractères (CDM) pour les formules, et distance d'édition d'arbre (TEDS) pour les tableaux. La récompense moyenne uniquement les composants présents dans la vérité terrain de chaque page, évitant le bruit des métriques non pertinentes.
Appliquer directement le RL au modèle 0,8B a provoqué une instabilité de la qualité des tableaux. L'équipe a donc utilisé le modèle 4B amélioré par RL comme enseignant pour une distillation on-policy (OPD). L'étudiant génère des sorties, l'enseignant les note, et l'étudiant apprend via la divergence KL inverse, orientée vers les jetons les plus confiants de l'enseignant. Une astuce top-k réduit le tenseur par position de la taille du vocabulaire à k, gardant la mémoire gérable pour des réponses longues. Cette méthode de distillation fait écho à l'approche utilisée dans la recette de distillation en cascade de Mistral.
Enfin, plusieurs variantes candidates sont fusionnées via une moyenne pondérée des paramètres.
Résultats des benchmarks en contexte
| Référence | OvisOCR2 | Meilleur pipeline (SOTA précédent) | Meilleur bout en bout (préc.) |
|---|---|---|---|
| OmniDocBench v1.6 (global) | 96,58 | 96,33 (PaddleOCR-VL-1.6) | 94,74 (HunyuanOCR-1.5) |
| PureDocBench (Avg3) | 75,06 | 70,39 (DotsMOCR, pipeline) | 73,92 (FD-RL, bout en bout) |
| Distance d'édition texte (OmniDocBench) | 0,025 | 0,033 (PaddleOCR-VL-1.6) | 0,039 (HunyuanOCR-1.5) |
| CDM formule (OmniDocBench) | 97,53 | 97,49 (PaddleOCR-VL-1.6) | 95,79 (Unlimited-OCR) |
Les améliorations sont cohérentes pour le texte, les formules, les tableaux et l'ordre de lecture, pas seulement la moyenne globale. Sur OmniDocBench, OvisOCR2 rapporte la distance d'édition texte la plus basse, le CDM formule le plus élevé, le TEDS tableau le plus élevé et la distance d'édition d'ordre de lecture la plus basse parmi tous les modèles spécialisés. Ce schéma d'un modèle plus petit surpassant des concurrents plus grands rappelle le Qwen2.5-Omni d'Alibaba, un modèle 7B qui frappe au-dessus de sa catégorie.
Ce que cela signifie pour le domaine
Le domaine de l'analyse de documents se dirigeait déjà vers des modèles unifiés. L'OCR 4 de Mistral a ajouté des boîtes englobantes et une classification par blocs typés dans un seul conteneur. DeepSeek-OCR 2 a introduit le Visual Causal Flow et open-sourcé ses poids. Les deux sont de bout en bout dans l'esprit mais reposent encore sur certains composants modulaires.
OvisOCR2 va plus loin : un seul modèle 0,8B qui produit directement du Markdown, sans analyseur de mise en page attaché. Le compromis est la robustesse réelle : sur le volet Real de PureDocBench (pages capturées par téléphone, photocopies, photographies d'écran), OvisOCR2 obtient un score de 66,56, inférieur à Gemini-3.1-Pro et Qwen3.5-122B-A10B. L'équipe reconnaît que la qualité d'image dégradée reste un point faible.
Néanmoins, la performance du modèle sur l'écriture manuscrite et les tableaux complexes, deux points douloureux pour les méthodes pipeline, est notablement forte. Sur un sous-ensemble manuscrit interne, OvisOCR2 atteint un score global de 72,28 contre 69,58 pour GLM-OCR. Sur les tableaux complexes, son taux de tableaux absents de la sortie tombe à 7,96 %, contre 13 à 17 % pour les analyseurs pipeline. Une fois que l'analyse de mise en page d'un pipeline manque un tableau, aucun reconnaisseur en aval ne peut le récupérer. La capacité à traiter des entrées difficiles avec un modèle compact reflète la tendance observée dans le modèle 8B de Mistral qui rend le lidar optionnel pour les robots de bureau.
Le modèle est disponible sur HuggingFace. Avec 0,8B paramètres, il peut fonctionner sur des GPU grand public ou même sur CPU avec optimisations, rendant l'analyse de documents de haute qualité accessible au-delà des entreprises bien dotées.
- Source : OvisOCR2 Technical Report (arXiv)
L'essentiel de la tech en 3 minutes chaque matin
Un email, chaque jour ouvré, avec ce qui compte vraiment en IA et en tech.