SevenTnewS

LLM & Modèles

Grands modèles de langage : GPT, Claude, Gemini, Mistral et poids ouverts.

93 published articles

3 min read

Recherche en IA

Penelope cache son raisonnement dans une seule couche de décodeur pour réduire les coûts d'inférence

Penelope, un framework de raisonnement latent pour Transformers à décodeur seul, localise le calcul récurrent dans un interval étroit du décodeur, réduisant la latence d'inférence sans perte majeure de précision. L'article décrit un curriculum qui déplace le raisonnement des tokens visibles vers une boucle GRU interne.

2026-08-04

3 min read

Recherche IA

Pourquoi la log-probabilité des tokens est le mauvais indicateur pour surveiller les modèles de raisonnement IA

Novelis Research montre que la log-probabilité des tokens échoue en tant que moniteur de décodeur pour les modèles de raisonnement quantifiés, étant aveugle aux boucles confiantes. Ils introduisent un contrôleur e-CUSUM calibré qui combine l'incertitude et les signaux de répétition, atteignant une sélectivité sur GSM8K avec DeepSeek-R1-Distill-Qwen-1.5B.

2026-08-03

3 min read

Recherche en IA

Le LLM qui a surpassé toutes les formules fixes pour l'allocation d'entrepôts chez JD.com

Un LLM entraîné par apprentissage par renforcement guidé par solveur choisit la meilleure formulation MIP pour chaque instance d'allocation de stocks chez JD.com. Le Hit Ratio@1 est passé de 21 % à 50 %, et la précision d'allocation réalisée a surpassé chaque formulation fixe de 12,57 points de pourcentage.

2026-08-03

2 min read

Recherche en IA

Pourquoi votre tuteur IA ne voit pas comment les mathématiques se construisent les unes sur les autres

Le K12-Bench de l'Université de Pékin révèle que même les meilleurs modèles de langage comprennent à peine comment les concepts scolaires sont reliés. Des scores de 57 % et 46 % montrent une lacune dans la capacité de l'IA à gérer les chaînes de prérequis, les taxonomies de concepts et l'ancrage visuel, des compétences que les tuteurs réels utilisent chaque jour.

2026-08-02

3 min read

Intelligence Artificielle

La génération d'idées de recherche s'améliore de 3,89x avec IDEAgent

IDEAgent utilise des lignées, des retours multi-objectifs et une mémoire séquentielle pour équilibrer qualité et diversité dans les idées de recherche générées par LLM. Testé sur 32 sujets dans 8 domaines de l'informatique, il atteint 3,89x le Yield (idées diverses au-dessus d'un seuil de qualité) des méthodes antérieures.

2026-08-02

3 min read

Raisonnement 3D

SceneActBench : Pourquoi même les meilleurs VLM échouent dans l'action 3D

SceneActBench teste onze configurations de VLM sur cinq tâches 3D dans une boucle d'agent unifiée. Les scores globaux vont de 38,6 à 50,2, aucun modèle n'étant performant de manière constante. Le benchmark expose un angle mort des agents vision-langage : agir sur des scènes complètes, pas seulement les décrire.

2026-07-31

4 min read

Distillation des LLM

La distillation des LLM stagne quand le contexte devient statique. Ce papier le fait évoluer

Les contextes peuvent transporter les préférences de tâche dans l'entraînement des LLM, mais une fois distillés dans un étudiant, ils n'apportent qu'une supervision limitée. Le Flux-OPD de l'université de Pékin maintient le contexte en mouvement avec l'étudiant et utilise un terme de conflit pour pondérer les corrections des enseignants. Le résumé rapporte des gains par rapport aux paradigmes OPD existants sans citer de chiffres.

2026-07-31

4 min read

Recherche en IA

L'écume dans le raisonnement en chaîne : un nouveau benchmark révèle pourquoi les LLM gaspillent des tokens sur des raisonnements valides mais inutiles

Les LLM génèrent souvent des chaînes de raisonnement correctes mais alourdies par des étapes inutiles. Un nouveau benchmark diagnostique et une méthode de compression montrent que les évaluateurs actuels ignorent totalement cette inefficacité et que la moitié des étapes de raisonnement rédigées par des humains pourraient être compressibles.

2026-07-31

4 min read

Recherche en bref

Les goulots d'étranglement structurés surpassent la magie des prompts dans les tâches d'induction des LLM

Une nouvelle méthodologie appelée Hourglass reasoning impose un isolement strict du contexte entre les étapes d'induction, de déduction et de mise en œuvre, ne transmettant qu'une règle symbolique compressée entre elles. Sur ARC-AGI-2, elle améliore la précision pass@5 jusqu'à 14 points par rapport au raffinement itératif ; sur la synthèse Verilog de ChipBench, elle double presque la précision avec GPT-5.5. Les ablations confirment que la topologie elle-même est à l'origine de l'amélioration.

2026-07-31

3 min read

Recherche en IA

Un petit contrôleur de surveillance améliore de 4,5 points les scores des LLM quantifiés sur MATH-500

Une nouvelle recherche propose un contrôleur de surveillance externe pour les petits modèles de langage quantifiés, qui détecte les chemins de raisonnement répétitifs ou dégénérés et déclenche un retour en arrière et un re-décodage contraint. La précision s'est améliorée de 4,5 points de pourcentage sur un large ensemble d'évaluation, mais les auteurs soulignent que les résultats ne sont pas confirmatoires.

2026-07-30

5 min read

IA de jeu

Les trois problèmes qu’aucun moteur de jeu IA n’avait résolus jusqu’à présent : cohérence, navigabilité et évaluation

MAGIC est un pipeline en quatre étapes qui convertit une seule invite en un projet Unity jouable avec plusieurs scènes connectées. Il garantit l’accessibilité des portails par un validateur de type flood-fill et introduit un agent d’évaluation qui traverse réellement chaque transition, complétant des décennies de métriques qui ne portaient que sur des intérieurs uniques.

2026-07-30

4 min read

Recherche en IA

Les agents d'IA conservaient la mémoire hors du modèle. Metis la met à l'intérieur.

Metis de MemTensor est le premier prototype de modèles de fondation de mémoire : l'historique est compressé dans le backbone, relu via l'attention mémoire, mis à jour en un seul passage forward. Il remet en cause l'ère du store vectoriel pour la mémoire des agents. Les limites sont reconnues mais pas encore quantifiées.

2026-07-30

← PreviousPage 2 / 8 · 93 articlesNext →