SevenTnewS

Analyse

Le modèle 0.8B qui a tout remis en question dans l'analyse de documents

OvisOCR2, un analyseur de documents à 0,8 milliard de paramètres de Tencent, a atteint 96,58 sur OmniDocBench, devenant le premier modèle de bout en bout à dominer le classement. Le modèle utilise l'apprentissage par renforcement et la distillation pour surpasser des systèmes en pipeline plus volumineux, remettant en question les hypothèses sur la nécessité des architectures multi-étapes.

Emmanuel Fabrice Omgbwa Yasse Assisté par IA

2026-07-26 · 3 min de lecture

Le modèle 0.8B qui a tout remis en question dans l'analyse de documents
Sources : OvisOCR2 Techni…

L'analyse de documents a longtemps été dominée par les systèmes en pipeline. Ces chaînes de modules spécialisés (détecteur de texte, reconnaisseur, analyseur de mise en page, analyseur de formules) ajoutent de la complexité et risquent de propager des erreurs en aval. La sagesse conventionnelle voulait qu'aucun modèle de bout en bout ne puisse égaler leur précision, en particulier sur des pages réelles désordonnées.

OvisOCR2 de Tencent remet en question cette sagesse. Avec seulement 0,8 milliard de paramètres, le modèle a obtenu 96,58 sur le classement OmniDocBench v1.6, la meilleure note globale pour toute méthode, pipeline ou de bout en bout. Le rapport technique publié le 15 juillet sur arXiv détaille comment l'équipe y est parvenue.

Schéma : Pipeline d'entraînement d'OvisOCR2
Le pipeline d'entraînement d'OvisOCR2, tel que décrit dans le rapport technique de Tencent, combine un moteur de données, un ajustement fin supervisé, un entraînement RL avec une récompense multi-composants, une distillation et une fusion de points de contrôle pour produire un modèle de bout en bout de 0,8 milliard de paramètres.

La recette d'entraînement est la véritable histoire. L'équipe a construit un moteur de données qui mélange des annotations de documents réels filtrées avec des pages synthétiques où l'image et la cible Markdown proviennent de la même source HTML, garantissant un alignement parfait. Après un ajustement fin supervisé, ils ont entraîné une branche de 4 milliards de paramètres en utilisant l'apprentissage par renforcement avec une récompense multi-composants qui évalue la précision, la structure et le formatage. Ils ont ensuite distillé ces connaissances dans le modèle 0,8B via une distillation sur politique et ont fusionné les poids de plusieurs points de contrôle. Résultat : un modèle de bout en bout qui bat des méthodes qui utilisent souvent cinq fois plus de paramètres et des modules séparés.

Cela va au-delà d'un seul benchmark. Sur PureDocBench, OvisOCR2 a obtenu 75,06, le Avg3 le plus élevé parmi les méthodes comparées. Un benchmark interne couvrant des mises en page plus diverses et difficiles a également montré que le modèle maintenait son avance, suggérant que l'approche se généralise au-delà des ensembles de tests organisés.

Le domaine évolue vers des conceptions de bout en bout. DeepSeek-OCR 2 et Mistral OCR 4 proposent tous deux une analyse de documents open source, mais aucun n'a revendiqué la première place sur OmniDocBench avec un modèle de bout en bout à cette échelle. DeepSeek-OCR 2 utilise une résolution dynamique et des jetons visuels, tandis que Mistral OCR 4 ajoute des boîtes englobantes et des scores de confiance par mot, tous deux s'orientant vers une structure de type pipeline. OvisOCR2 est pur bout en bout : image de page en entrée, Markdown en sortie, sans boîtes ni étapes intermédiaires.

Les implications pratiques sont claires. Pour les développeurs construisant des flux de travail documentaires, un seul modèle 0,8B qui gère le texte, les tableaux, les formules et la mise en page en une seule passe simplifie l'infrastructure et réduit la latence. Il abaisse également la barrière pour l'exécution sur des appareils périphériques ou dans des environnements à faibles ressources.

Il reste des questions ouvertes. L'article ne précise pas le coût de calcul de l'entraînement, la vitesse d'inférence ni la composition exacte des données synthétiques. Le modèle est disponible sur GitHub, mais le lien du dépôt n'est pas entièrement développé dans la prépublication. La reproduction indépendante et les benchmarks de latence diront si le score de 96,58 se traduit par un débit dans le monde réel.

Quoi qu'il en soit, le résultat d'OvisOCR2 est un jalon. Il prouve qu'avec une qualité de données suffisante et un pipeline d'entraînement intelligent, les petits modèles de bout en bout peuvent rivaliser et gagner contre des systèmes modulaires qui ont eu des années d'avance en matière d'optimisation. Le fardeau incombe désormais au camp des pipelines de justifier leur complexité.

L'essentiel de la tech en 3 minutes chaque matin

Un email, chaque jour ouvré, avec ce qui compte vraiment en IA et en tech.