IA
Intelligence artificielle : LLM, agents, diffusion, vision, NLP et les dernières nouvelles des grands laboratoires.
565 published articles
Stratégie IA
Le pari open-weight de la Chine divise la Silicon Valley
Alors que les modèles open-weight chinois comme Kimi K3 égalent les systèmes frontières américains sur les benchmarks tout en étant donnés gratuitement, la Silicon Valley est divisée : une coalition de 41 entreprises défend l'ouverture tandis qu'Anthropic et d'autres se retiennent, et un incident de sécurité impliquant un modèle incontrôlé ne fait qu'accentuer le fossé.
2026-07-31
Recherche en bref
Les goulots d'étranglement structurés surpassent la magie des prompts dans les tâches d'induction des LLM
Une nouvelle méthodologie appelée Hourglass reasoning impose un isolement strict du contexte entre les étapes d'induction, de déduction et de mise en œuvre, ne transmettant qu'une règle symbolique compressée entre elles. Sur ARC-AGI-2, elle améliore la précision pass@5 jusqu'à 14 points par rapport au raffinement itératif ; sur la synthèse Verilog de ChipBench, elle double presque la précision avec GPT-5.5. Les ablations confirment que la topologie elle-même est à l'origine de l'amélioration.
2026-07-31
Recherche en IA
L'écume dans le raisonnement en chaîne : un nouveau benchmark révèle pourquoi les LLM gaspillent des tokens sur des raisonnements valides mais inutiles
Les LLM génèrent souvent des chaînes de raisonnement correctes mais alourdies par des étapes inutiles. Un nouveau benchmark diagnostique et une méthode de compression montrent que les évaluateurs actuels ignorent totalement cette inefficacité et que la moitié des étapes de raisonnement rédigées par des humains pourraient être compressibles.
2026-07-31
Vision par ordinateur, modèles du monde et recherche en IA
PhiZero : apprendre à l'IA vidéo à raisonner en physique avant le rendu
PhiZero, un modèle du monde du CASIA, apprend un « langage physique » discret et compact à partir de vidéos brutes et l'utilise pour raisonner sur la manière dont une scène va évoluer avant de générer les images. Les auteurs soutiennent que cette conception « raisonner puis rendre » produit des vidéos physiquement plus cohérentes que la prédiction directe des pixels.
2026-07-31
Recherche en IA
Memory Decoder : une mémoire greffée de 6,9B fait battre Pythia-12B par un modèle de 410M
Memory Decoder at Scale sépare la mémoire à long terme du raisonnement dans les LLM. Une mémoire pré-entraînée de 6,9B a fait passer Pythia-410M devant Pythia-12B sur 17 benchmarks avec 39 % de paramètres en moins ; des mémoires de domaine de 1,7B ont ajouté plus de 9 points à Qwen3 Base à toutes les échelles testées.
2026-07-31
Distillation des LLM
La distillation des LLM stagne quand le contexte devient statique. Ce papier le fait évoluer
Les contextes peuvent transporter les préférences de tâche dans l'entraînement des LLM, mais une fois distillés dans un étudiant, ils n'apportent qu'une supervision limitée. Le Flux-OPD de l'université de Pékin maintient le contexte en mouvement avec l'étudiant et utilise un terme de conflit pour pondérer les corrections des enseignants. Le résumé rapporte des gains par rapport aux paradigmes OPD existants sans citer de chiffres.
2026-07-31
Frontis-MA1 / OpenMLE
L'IA qui améliore l'IA tourne désormais sur une seule RTX 4090
La pile OpenMLE de FrontisAI et l'agent Frontis-MA1 de 35 milliards de paramètres transforment l'auto-amélioration récursive en une expérience reproductible. Sur une seule RTX 4090, le modèle obtient 71,21 % sur MLE-Bench Lite, devant GPT-5.5 + Codex et proche de modèles frontières bien plus grands.
2026-07-31
Agents GUI
L'agent Qwen-UI-Agent d'Alibaba obtient de meilleurs scores sur de vrais téléphones que dans les sandboxes
Le Qwen-UI-Agent du laboratoire Tongyi d'Alibaba revendique des scores mobiles de pointe (97,5 % sur AndroidDaily) et des résultats compétitifs en usage informatique face à Opus 4.8, Gemini 3.1 Pro et GPT-5.6 Sol. Son score sur benchmark sur appareil réel dépasse son score en sandbox, tandis que 40 % de progression partielle sur OSWorld-v2 constitue la limite honnête.
2026-07-31
Recherche dans la littérature scientifique
Les chimistes cherchent dans les articles ; AskChem répond avec 2,4 millions d'affirmations
AskChem indexe 2,4 millions d'affirmations en chimie issues de 147 000 articles, chacune adossée à un DOI source et à une citation textuelle, servies aux scientifiques et aux agents d'IA via une application web, REST, un SDK et MCP. Sur AskChem-Bench, la résolution des DOI pour un lecteur GPT-5.5 est passée de 88,3 % à 100 %.
2026-07-31
Évaluation ancrée vs. non ancrée
Pourquoi l’auto-évaluation de votre modèle d’IA échoue sur la qualité visuelle
Une nouvelle recherche introduit l’« ancrage » comme variable clé régissant un troisième axe du calcul au moment du test : le dimensionnement par interaction. Les résultats montrent qu’un instrument déterministe mesurant la disposition réelle surpasse l’évaluation VLM sur capture d’écran, corrigeant 40 % des défauts sur les diapositives denses et 74 % des défauts sur les figures académiques, alors que la métrique standard ne voit rien.
2026-07-31
Recherche en IA
La génération vidéo devient 120 fois plus rapide sur un seul GPU : au cœur de l'avancée de Nvidia sur l'attention hybride
La SANA-Video 2.0 de Nvidia Research combine l'attention linéaire et softmax périodique dans un ratio 3:1 pour fonctionner 120 fois plus vite que Wan 2.2 sur un seul H100. La conception hybride retrouve une expressivité de plein rang tout en maintenant une inférence à 13 secondes pour un clip 720p. Les réserves : les benchmarks s'arrêtent à 720p et intègrent le changement d'attention avec des optimisations propriétaires.
2026-07-31
Politique de l'IA
Le terrain d'entente nuancé d'Anthropic sur les modèles d'IA à poids ouverts
Amodei décrit deux scénarios cauchemardesques, la supériorité militaire autoritaire et les risques de mauvaise utilisation, et soutient que les interdictions générales des modèles à poids ouverts passent à côté du vrai problème.
2026-07-31