LLM & Modèles
Grands modèles de langage : GPT, Claude, Gemini, Mistral et poids ouverts.
93 published articles
Apprentissage par renforcement
L'apprentissage expérientiel de Microsoft donne aux modèles d'IA un coach, pas seulement une note
L'Apprentissage Expérientiel réutilise le LLM-comme-Juge en un LLM-comme-Coach qui extrait une connaissance transférable de chaque réponse et l'internalise via une distillation de contexte sur politique, surpassant le RL basé sur des grilles sur des tâches non vues et réduisant le piratage de récompense.
2026-07-30
Interprétabilité mécaniste
Ce que gemma-4 sait réellement de la physique : un nouvel article révèle que les représentations sont réelles
De nouvelles recherches sur gemma-4-E4B-it révèlent que les représentations internes des mécanismes de science des matériaux du modèle sont liées de manière causale à ses réponses. L'étude combine plusieurs techniques de sondage et d'intervention pour montrer que la connaissance de la physique est encodée dans les transformations d'état, et pas seulement dans des motifs statiques.
2026-07-29
Recherche en IA
Les affirmations de risque des têtes de RL distributionnel sont en grande partie fausses, selon un nouvel audit
Un audit à grande échelle montre que les agents de RL distributionnel fabriquent systématiquement des compromis de risque dans les états mêmes où les praticiens leur feraient le plus confiance. Pour QR-DQN, C51 et IQN sur MinAtar, zéro des affirmations les plus fortes étaient confirmables, et agir sur les conseils CVaR des agents donnait parfois des résultats significativement pires que le hasard.
2026-07-29
IA Open Source
L'AV-Flamingo de Nvidia s'attaque à la compréhension des longues vidéos là où la plupart des modèles échouent
Nvidia publie AV-Flamingo, un grand modèle de langage audiovisuel open source conçu pour la compréhension de vidéos longues et complexes. Il utilise un programme d'apprentissage en trois étapes et un cadre de chaîne de pensée horodatée pour gérer le raisonnement temporel et cross-modal qui fait trébucher la plupart des modèles.
2026-07-28
Sciences comportementales
Les décisions humaines que les LLM peuvent reproduire mieux que les enquêtes
Une étude utilisant 3 000 agents basés sur GPT-5 dans des expériences de choix d'itinéraire montre que les LLM reproduisent les biais de la théorie des perspectives cumulées (CPT), l'aversion aux pertes, la dépendance aux points de référence et la pondération des probabilités, avec une grande fidélité. L'approche contourne le goulot d'étranglement de l'estimation des paramètres qui limite la modélisation comportementale traditionnelle.
2026-07-28
Modèles d'IA
La conception à quatre spécialistes de 748B du Macaron-V1-Venti bat GPT-5.5 et Opus 4.8
Macaron-V1-Venti de MindLab Research mène les benchmarks en intelligence personnelle, codage, utilisation du terminal et UI générative, utilisant une nouvelle architecture Mixture of LoRA qui maintient le modèle compact tout en étant spécialisé.
2026-07-27
IA Open Source
Kimi K3 est le plus grand modèle open source jamais créé. Il n'est toujours pas le meilleur.
Kimi K3 est le plus grand modèle open source avec 2,8 billions de paramètres, mais il ne parvient pas à battre les meilleurs modèles propriétaires sur les benchmarks globaux. Bien qu'il excelle sur des tâches spécifiques de codage et d'agents, l'écart avec les leaders de pointe comme Claude Fable 5 et GPT 5.6 Sol expose les limites du passage à l'échelle sans percées architecturales et de données.
2026-07-27
Finance Agentique
La boîte noire de votre portefeuille est sur le point de s’ouvrir : dans les coulisses du premier tracker financier agentique en direct
NextFund enregistre chaque décision prise par un agent de trading IA sur les marchés en direct, permettant aux utilisateurs de comparer les modèles, d’inspecter les justifications et de diagnostiquer les défaillances. Un test sur huit LLM portant sur des actions américaines, chinoises et hongkongaises montre que des signaux intermédiaires similaires peuvent diverger en comportements de portefeuille nettement différents, et que les classements trimestriels basculent selon la métrique privilégiée.
2026-07-27
Recherche en IA
Quand un graphe sait ce que vous n'avez pas appris : un nouveau modèle d'apprenant
MR-ConceptGCN combine des graphes de connaissances personnels avec des GCN multi-relationnels et des embeddings SBERT pour produire des modèles d'apprenant séquentiels. Dans une étude de 31 personnes, il a amélioré la précision, l'utilité, la diversité et la satisfaction des recommandations par rapport aux approches de référence.
2026-07-26
Coût vs. capacité
Le modèle à $1.40 qui a écrasé son homologue à $2.82 en physique
Quatre modèles d'IA ont été invités à construire des scènes HTML avec une physique réaliste. Opus 5 a réussi les trois au coût le plus bas parmi les meilleurs performeurs, tandis que Fable 5 a échoué à chacune au double du prix.
2026-07-25
Recherche
Le fossé de supervision en RL agentique vient d'être comblé par le regard rétrospectif
SEED (Self-Evolving On-Policy Distillation) permet à un LLM d'analyser ses propres trajectoires passées, d'en extraire des compétences réutilisables en langage naturel après coup, puis de distiller ces leçons dans sa politique pendant le RL. Le résultat : une supervision plus dense et en politique qui améliore l'efficacité d'échantillonnage et se généralise à des tâches inédites.
2026-07-25
Modèles d'IA
Claude Opus 5 égale presque Fable 5 sur tous les benchmarks, avec la cybersécurité comme angle mort délibéré
Claude Opus 5 est lancé avec des scores proches de Fable sur les benchmarks de codage et de connaissances à moitié prix. Mais ses capacités délibérément affaiblies en cybersécurité créent un compromis clair pour les développeurs.
2026-07-24