SevenTnewS

apprentissage par renforcement

29 published articles

LLM & ModèlesFeatured4 min read

IA documentaire

Le modèle 0,8B qui a battu tous les analyseurs de documents pipeline sur leur propre terrain

L'OvisOCR2 d'Alibaba, un modèle compact de bout en bout de 0,8B, atteint des scores de pointe sur OmniDocBench (96,58) et PureDocBench (75,06), dépassant les analyseurs pipeline plus grands. Son succès vient d'un moteur de données mélangeant des documents réels filtrés et des pages synthétiques, d'un apprentissage par renforcement sur un enseignant 4B et d'une distillation on-policy dans le petit modèle.

2026-07-24

Qwen / AlibabaFeatured4 min read

Agents de codage IA

Le Qwen-Coder-Qoder d'Alibaba bat Cursor sur son propre test et réduit l'utilisation de jetons de 14,5 %

Le nouveau modèle de codage d'Alibaba, Qwen-Coder-Qoder, bat Cursor Composer-1 sur le benchmark Qoder Bench. Les mesures de production montrent une augmentation de 3,85 % de la rétention de code, une baisse de 61,5 % des erreurs d'outils et une réduction de 14,5 % de l'utilisation des jetons. Le modèle s'entraîne sur des traces d'agents réelles via un cadre récompenseur-attaqueur contre le contournement des récompenses.

2026-07-23

Sakana AIFeatured1 min read

Apprentissage Biologiquement Plausible

Échangez MNIST contre CIFAR-10 et la recette de l'IA cérébrale bascule complètement

Sakana AI a pour la première fois étendu une architecture sans rétropropagation et conforme à Dale au-delà de MNIST. La particularité : l'astuce la plus importante s'inverse d'un jeu de données à l'autre, un avertissement sur la manière dont l'IA biologiquement plausible est mesurée.

2026-07-22

LLM & ModèlesFeatured5 min read

Recherche en IA

Apprentissage par renforcement pour la génération d'images : Qwen-Image-2.0-RL adopte un système de récompense composite

Le rapport Qwen-Image-2.0-RL détaille un pipeline de post-entraînement combinant RLHF, distillation sur politique et modèles de récompense composites pour améliorer la qualité de la génération texte-image et de l'édition d'images. L'approche produit des gains mesurables en qualité esthétique, respect des instructions et préservation de l'identité faciale.

2026-07-20

Sakana AI7 min read

IA biologiquement plausible

Un correctif a sauvé CIFAR-10 et n'a rien fait pour MNIST, et cela devrait inquiéter les chercheurs en IA

L'Error Diffusion de Sakana AI étend l'apprentissage sans rétropropagation, semblable au cerveau, à CIFAR-10 et au RL. Le hic : quels choix de conception sont importants s'inverse entre les benchmarks, et le coût du principe de Dale augmente avec la difficulté de la tâche.

2026-07-19

Laboratoires & RechercheFeatured4 min read

Recherche en IA

Le correctif en deux mots pour le problème d'auto-sabotage de l'apprentissage par renforcement

L'apprentissage par renforcement multitâche cache un secret : les signaux de récompense qui guident l'alignement fonctionnent souvent les uns contre les autres. Une équipe internationale vient de publier une méthode qui empêche le système de lutter contre lui-même, et son coût d'ajout aux pipelines existants est quasi nul.

2026-07-19

LLM & ModèlesFeatured4 min read

IA incarnée

Le modèle 8B de Mistral rend le lidar optionnel pour les robots de bureau

Robostral Navigate de Mistral AI est un modèle 8B qui utilise une seule caméra RGB pour atteindre 76,6 % sur les benchmarks R2R-CE, surpassant de 4,5 points les approches multi-capteurs. Construit avec des données simulées et une méthode de cache de préfixes efficace en tokens, il se généralise à travers différents types de robots et s'adapte aux obstacles inédits.

2026-07-17

IAFeatured5 min read

Recherche en IA

Le goulot d'étranglement qui freine les agents d'IA n'est pas l'exploration, mais l'évaluation

Deux nouveaux articles de Hugging Face s'attaquent au même problème central depuis des directions opposées : comment rendre les agents d'IA capables d'évaluer leurs propres actions de manière fiable. AJ-Bench construit un benchmark pour des agents juges conscients de leur environnement, tandis que HeavySkill soutient que le meilleur juge réside à l'intérieur des paramètres du modèle.

2026-07-17

LLM & Modèles4 min read

Intelligence artificielle

Alibaba a rendu open source un modèle du monde qui permet aux agents d’IA de s’entraîner dans un simulateur

L’équipe Qwen d’Alibaba a publié Qwen-AgentWorld, un modèle du monde basé sur le langage qui simule des environnements d’agents dans sept domaines. Son pipeline en trois étapes, CPT, SFT, RL, produit un simulateur qui bat GPT-5.4 en fidélité et permet aux agents de s’entraîner via une répétition mentale plutôt que par des déploiements coûteux en environnement réel.

2026-07-16

LLM & Modèles2 min read

Programmation compétitive

NousCoder-14B défie la programmation olympiade avec un pipeline RL ouvert

Nous Research publie NousCoder-14B, un modèle de programmation compétitive basé sur Qwen3-14B via RL. Pile ouverte complète : poids, environnement et suite d'évaluation. Cible les benchmarks de codage de niveau olympiade.

2026-07-16

IAFeatured5 min read

Intelligence Artificielle

MiniMax M3 et l'art de fabriquer un modèle de preuve résistant à la triche

MiniMax détaille l'ingénierie derrière les capacités de preuve de M3 : un vérificateur en profondeur qui a survécu au mode de défaillance de piratage des récompenses du cycle M2, et MaxProof, un cadre de passage à l'échelle au niveau de la population qui transforme l'échantillonnage en recherche guidée. Sur l'IMO 2025 et l'USAMO 2026, M3 avec MaxProof dépasse le seuil de la médaille d'or humaine.

2026-07-16

Outils & FrameworksFeatured2 min read

Outillage pour RL

Tinker-atropos relie les expériences RL au cadre Atropos

Nous Research publie tinker-atropos, une couche d'intégration entre l'API Tinker et le cadre RL Atropos. Découple les services d'entraîneur, de déroulement et d'environnement en composants déployables indépendamment pour des expériences RL plus flexibles.

2026-07-16

← PreviousPage 2 / 3 · 29 articlesNext →