SevenTnewS

apprentissage par renforcement

29 published articles

Laboratoires & Recherche3 min read

Fisher-R1 | Test d'hypothèses

Les agents IA produisent des statistiques sans faille et tirent pourtant de mauvaises conclusions

Les agents qui automatisent les tests d'hypothèses peuvent exécuter des analyses sans faille tout en parvenant à de mauvaises conclusions, car la plupart des benchmarks ne vérifient jamais si la valeur p est valide. Un benchmark de 425 tâches quantifie cet écart, et un modèle open-weight entraîné par RL en comble une partie.

2026-08-19

LLM & Modèles3 min read

Recherche

Votre modèle d'IA utilisant des outils complique les questions faciles

Un nouvel article de KlingTeam mesure quand les modèles multimodaux ont réellement besoin d'outils et quand les outils nuisent. Le modèle Beacon proposé, entraîné avec des récompenses sensibles à la nécessité, améliore à la fois la précision et la discipline d'utilisation des outils.

2026-08-09

IA3 min read

IA explicable

Le bouton que personne ne voulait tourner : dtControl2+ε permet de sacrifier l'optimalité pour la clarté

Une nouvelle extension de dtControl2 permet aux ingénieurs d'échanger une quantité précise de performance contre des arbres de décision plus petits et plus compréhensibles. L'outil, dtControl2+ε, garantit l'ε-optimalité tout en élaguant les arbres à des ordres de grandeur de nœuds en moins.

2026-08-05

Open Source2 min read

Open Source

OpenForgeRL entraîne des agents IA sans toucher à leurs infrastructures d'inférence

OpenForgeRL utilise un proxy et Kubernetes pour entraîner des agents IA sans modifier leurs infrastructures d'inférence. Lors des tests, OpenForgeGUI a égalé des modèles plusieurs fois plus grands sur des benchmarks de navigation web et de bureau.

2026-08-01

Agents IA3 min read

IA de recherche approfondie

Le nouvel agent de recherche de BAAI ne se contente pas de chercher plus longtemps, il vérifie ses propres devoirs

Les agents AREX de BAAI utilisent une boucle d'auto-amélioration récursive qui compresse les longs historiques de recherche, permettant un raffinement efficace axé sur la vérification. Entraînés avec une nouvelle recette de RL à long horizon, ils surpassent les bases de référence comparables sur BrowseComp, DeepSearchQA et HLE.

2026-07-31

LLM & Modèles3 min read

Apprentissage par renforcement

L'apprentissage expérientiel de Microsoft donne aux modèles d'IA un coach, pas seulement une note

L'Apprentissage Expérientiel réutilise le LLM-comme-Juge en un LLM-comme-Coach qui extrait une connaissance transférable de chaque réponse et l'internalise via une distillation de contexte sur politique, surpassant le RL basé sur des grilles sur des tâches non vues et réduisant le piratage de récompense.

2026-07-30

Laboratoires & RechercheFeatured1 min read

Recherche

Le RL explicable s'attaque au contrôle du trafic aérien, une carte de saillance à la fois

Une équipe de chercheurs applique le RL explicable au contrôle du trafic aérien, en formant un agent à éviter les zones interdites et en utilisant des cartes de saillance pour révéler son raisonnement. Ce travail est une étape préliminaire vers la confiance dans l'IA à enjeux élevés.

2026-07-27

NLP & ML3 min read

Recherche

La mémoire partagée a ses limites : les algorithmes acteur-critique peinent à passer l'échelle au-delà de cinq agents

Des chercheurs ont partagé des buffers de répétition entre des agents acteur-critique sur des tâches d'actions paramétrées. GAC a bondi en performance, tandis que SAC et TQC n'ont que faiblement progressé. Au-delà de cinq agents, le coût de calcul grimpe sans retour significatif. L'article propose une limite pratique pour savoir jusqu'où les méthodes d'expérience partagée peuvent s'étendre avant de plafonner.

2026-07-27

IA4 min read

Recherche BCI

L'apprentissage par renforcement améliore de 41 % le décodage des interfaces cerveau-ordinateur

Les chercheurs proposent CNN-LSTM-RL, un cadre en deux étapes qui applique l'apprentissage par renforcement pour corriger les erreurs systématiques dans les décodeurs d'interface cerveau-ordinateur non invasifs. Sans aucune donnée neuronale supplémentaire, la méthode a amélioré la corrélation de décodage de mouvement 3D de 41,5 % et réduit l'erreur quadratique moyenne de 40,2 % chez dix participants.

2026-07-27

IA3 min read

Apprentissage par renforcement

Des chercheurs de Meta et de l'UIUC entraînent des modèles vision-langage à vérifier leur propre travail et à repenser les mauvaises réponses

SVR-R1 transforme l'auto-verdict binaire d'un modèle vision-langage en un signal d'apprentissage. Testé sur des benchmarks de raisonnement sur graphiques et tableaux, il surpasse largement le GRPO standard tandis que le modèle réduit progressivement le nombre de tours de vérification, indiquant qu'il internalise l'auto-correction.

2026-07-25

IAFeatured3 min read

Intelligence artificielle

Des modèles plus petits qui se remettent constamment en question peuvent battre des modèles 10 fois plus grands

RefineRL entraîne de petits modèles de langage à affiner itérativement leurs propres solutions de programmation compétitive à l'aide d'un agent sceptique et d'un apprentissage par renforcement. Un modèle de 4B utilisant cette méthode surpasse les modèles de 32B et approche les performances des modèles de 235B, suggérant que l'auto-affinage, et non la taille brute, pourrait être une voie d'échelle plus robuste pour les tâches de raisonnement.

2026-07-25

LLM & ModèlesFeatured4 min read

Recherche

Le fossé de supervision en RL agentique vient d'être comblé par le regard rétrospectif

SEED (Self-Evolving On-Policy Distillation) permet à un LLM d'analyser ses propres trajectoires passées, d'en extraire des compétences réutilisables en langage naturel après coup, puis de distiller ces leçons dans sa politique pendant le RL. Le résultat : une supervision plus dense et en politique qui améliore l'efficacité d'échantillonnage et se généralise à des tâches inédites.

2026-07-25

← PreviousPage 1 / 3 · 29 articlesNext →