LLM & Modèles
Grands modèles de langage : GPT, Claude, Gemini, Mistral et poids ouverts.
93 published articles
Recherche en IA
Penelope cache son raisonnement dans une seule couche de décodeur pour réduire les coûts d'inférence
Penelope, un framework de raisonnement latent pour Transformers à décodeur seul, localise le calcul récurrent dans un interval étroit du décodeur, réduisant la latence d'inférence sans perte majeure de précision. L'article décrit un curriculum qui déplace le raisonnement des tokens visibles vers une boucle GRU interne.
2026-08-04
Recherche IA
Pourquoi la log-probabilité des tokens est le mauvais indicateur pour surveiller les modèles de raisonnement IA
Novelis Research montre que la log-probabilité des tokens échoue en tant que moniteur de décodeur pour les modèles de raisonnement quantifiés, étant aveugle aux boucles confiantes. Ils introduisent un contrôleur e-CUSUM calibré qui combine l'incertitude et les signaux de répétition, atteignant une sélectivité sur GSM8K avec DeepSeek-R1-Distill-Qwen-1.5B.
2026-08-03
Recherche en IA
Le LLM qui a surpassé toutes les formules fixes pour l'allocation d'entrepôts chez JD.com
Un LLM entraîné par apprentissage par renforcement guidé par solveur choisit la meilleure formulation MIP pour chaque instance d'allocation de stocks chez JD.com. Le Hit Ratio@1 est passé de 21 % à 50 %, et la précision d'allocation réalisée a surpassé chaque formulation fixe de 12,57 points de pourcentage.
2026-08-03
Recherche en IA
Pourquoi votre tuteur IA ne voit pas comment les mathématiques se construisent les unes sur les autres
Le K12-Bench de l'Université de Pékin révèle que même les meilleurs modèles de langage comprennent à peine comment les concepts scolaires sont reliés. Des scores de 57 % et 46 % montrent une lacune dans la capacité de l'IA à gérer les chaînes de prérequis, les taxonomies de concepts et l'ancrage visuel, des compétences que les tuteurs réels utilisent chaque jour.
2026-08-02
Intelligence Artificielle
La génération d'idées de recherche s'améliore de 3,89x avec IDEAgent
IDEAgent utilise des lignées, des retours multi-objectifs et une mémoire séquentielle pour équilibrer qualité et diversité dans les idées de recherche générées par LLM. Testé sur 32 sujets dans 8 domaines de l'informatique, il atteint 3,89x le Yield (idées diverses au-dessus d'un seuil de qualité) des méthodes antérieures.
2026-08-02
Raisonnement 3D
SceneActBench : Pourquoi même les meilleurs VLM échouent dans l'action 3D
SceneActBench teste onze configurations de VLM sur cinq tâches 3D dans une boucle d'agent unifiée. Les scores globaux vont de 38,6 à 50,2, aucun modèle n'étant performant de manière constante. Le benchmark expose un angle mort des agents vision-langage : agir sur des scènes complètes, pas seulement les décrire.
2026-07-31
Distillation des LLM
La distillation des LLM stagne quand le contexte devient statique. Ce papier le fait évoluer
Les contextes peuvent transporter les préférences de tâche dans l'entraînement des LLM, mais une fois distillés dans un étudiant, ils n'apportent qu'une supervision limitée. Le Flux-OPD de l'université de Pékin maintient le contexte en mouvement avec l'étudiant et utilise un terme de conflit pour pondérer les corrections des enseignants. Le résumé rapporte des gains par rapport aux paradigmes OPD existants sans citer de chiffres.
2026-07-31
Recherche en IA
L'écume dans le raisonnement en chaîne : un nouveau benchmark révèle pourquoi les LLM gaspillent des tokens sur des raisonnements valides mais inutiles
Les LLM génèrent souvent des chaînes de raisonnement correctes mais alourdies par des étapes inutiles. Un nouveau benchmark diagnostique et une méthode de compression montrent que les évaluateurs actuels ignorent totalement cette inefficacité et que la moitié des étapes de raisonnement rédigées par des humains pourraient être compressibles.
2026-07-31
Recherche en bref
Les goulots d'étranglement structurés surpassent la magie des prompts dans les tâches d'induction des LLM
Une nouvelle méthodologie appelée Hourglass reasoning impose un isolement strict du contexte entre les étapes d'induction, de déduction et de mise en œuvre, ne transmettant qu'une règle symbolique compressée entre elles. Sur ARC-AGI-2, elle améliore la précision pass@5 jusqu'à 14 points par rapport au raffinement itératif ; sur la synthèse Verilog de ChipBench, elle double presque la précision avec GPT-5.5. Les ablations confirment que la topologie elle-même est à l'origine de l'amélioration.
2026-07-31
Recherche en IA
Un petit contrôleur de surveillance améliore de 4,5 points les scores des LLM quantifiés sur MATH-500
Une nouvelle recherche propose un contrôleur de surveillance externe pour les petits modèles de langage quantifiés, qui détecte les chemins de raisonnement répétitifs ou dégénérés et déclenche un retour en arrière et un re-décodage contraint. La précision s'est améliorée de 4,5 points de pourcentage sur un large ensemble d'évaluation, mais les auteurs soulignent que les résultats ne sont pas confirmatoires.
2026-07-30
IA de jeu
Les trois problèmes qu’aucun moteur de jeu IA n’avait résolus jusqu’à présent : cohérence, navigabilité et évaluation
MAGIC est un pipeline en quatre étapes qui convertit une seule invite en un projet Unity jouable avec plusieurs scènes connectées. Il garantit l’accessibilité des portails par un validateur de type flood-fill et introduit un agent d’évaluation qui traverse réellement chaque transition, complétant des décennies de métriques qui ne portaient que sur des intérieurs uniques.
2026-07-30
Recherche en IA
Les agents d'IA conservaient la mémoire hors du modèle. Metis la met à l'intérieur.
Metis de MemTensor est le premier prototype de modèles de fondation de mémoire : l'historique est compressé dans le backbone, relu via l'attention mémoire, mis à jour en un seul passage forward. Il remet en cause l'ère du store vectoriel pour la mémoire des agents. Les limites sont reconnues mais pas encore quantifiées.
2026-07-30