SevenTnewS

IA

Intelligence artificielle : LLM, agents, diffusion, vision, NLP et les dernières nouvelles des grands laboratoires.

565 published articles

3 min read

Stratégie IA

Le pari open-weight de la Chine divise la Silicon Valley

Alors que les modèles open-weight chinois comme Kimi K3 égalent les systèmes frontières américains sur les benchmarks tout en étant donnés gratuitement, la Silicon Valley est divisée : une coalition de 41 entreprises défend l'ouverture tandis qu'Anthropic et d'autres se retiennent, et un incident de sécurité impliquant un modèle incontrôlé ne fait qu'accentuer le fossé.

2026-07-31

4 min read

Recherche en bref

Les goulots d'étranglement structurés surpassent la magie des prompts dans les tâches d'induction des LLM

Une nouvelle méthodologie appelée Hourglass reasoning impose un isolement strict du contexte entre les étapes d'induction, de déduction et de mise en œuvre, ne transmettant qu'une règle symbolique compressée entre elles. Sur ARC-AGI-2, elle améliore la précision pass@5 jusqu'à 14 points par rapport au raffinement itératif ; sur la synthèse Verilog de ChipBench, elle double presque la précision avec GPT-5.5. Les ablations confirment que la topologie elle-même est à l'origine de l'amélioration.

2026-07-31

4 min read

Recherche en IA

L'écume dans le raisonnement en chaîne : un nouveau benchmark révèle pourquoi les LLM gaspillent des tokens sur des raisonnements valides mais inutiles

Les LLM génèrent souvent des chaînes de raisonnement correctes mais alourdies par des étapes inutiles. Un nouveau benchmark diagnostique et une méthode de compression montrent que les évaluateurs actuels ignorent totalement cette inefficacité et que la moitié des étapes de raisonnement rédigées par des humains pourraient être compressibles.

2026-07-31

4 min read

Vision par ordinateur, modèles du monde et recherche en IA

PhiZero : apprendre à l'IA vidéo à raisonner en physique avant le rendu

PhiZero, un modèle du monde du CASIA, apprend un « langage physique » discret et compact à partir de vidéos brutes et l'utilise pour raisonner sur la manière dont une scène va évoluer avant de générer les images. Les auteurs soutiennent que cette conception « raisonner puis rendre » produit des vidéos physiquement plus cohérentes que la prédiction directe des pixels.

2026-07-31

3 min read

Recherche en IA

Memory Decoder : une mémoire greffée de 6,9B fait battre Pythia-12B par un modèle de 410M

Memory Decoder at Scale sépare la mémoire à long terme du raisonnement dans les LLM. Une mémoire pré-entraînée de 6,9B a fait passer Pythia-410M devant Pythia-12B sur 17 benchmarks avec 39 % de paramètres en moins ; des mémoires de domaine de 1,7B ont ajouté plus de 9 points à Qwen3 Base à toutes les échelles testées.

2026-07-31

4 min read

Distillation des LLM

La distillation des LLM stagne quand le contexte devient statique. Ce papier le fait évoluer

Les contextes peuvent transporter les préférences de tâche dans l'entraînement des LLM, mais une fois distillés dans un étudiant, ils n'apportent qu'une supervision limitée. Le Flux-OPD de l'université de Pékin maintient le contexte en mouvement avec l'étudiant et utilise un terme de conflit pour pondérer les corrections des enseignants. Le résumé rapporte des gains par rapport aux paradigmes OPD existants sans citer de chiffres.

2026-07-31

4 min read

Frontis-MA1 / OpenMLE

L'IA qui améliore l'IA tourne désormais sur une seule RTX 4090

La pile OpenMLE de FrontisAI et l'agent Frontis-MA1 de 35 milliards de paramètres transforment l'auto-amélioration récursive en une expérience reproductible. Sur une seule RTX 4090, le modèle obtient 71,21 % sur MLE-Bench Lite, devant GPT-5.5 + Codex et proche de modèles frontières bien plus grands.

2026-07-31

3 min read

Agents GUI

L'agent Qwen-UI-Agent d'Alibaba obtient de meilleurs scores sur de vrais téléphones que dans les sandboxes

Le Qwen-UI-Agent du laboratoire Tongyi d'Alibaba revendique des scores mobiles de pointe (97,5 % sur AndroidDaily) et des résultats compétitifs en usage informatique face à Opus 4.8, Gemini 3.1 Pro et GPT-5.6 Sol. Son score sur benchmark sur appareil réel dépasse son score en sandbox, tandis que 40 % de progression partielle sur OSWorld-v2 constitue la limite honnête.

2026-07-31

4 min read

Recherche dans la littérature scientifique

Les chimistes cherchent dans les articles ; AskChem répond avec 2,4 millions d'affirmations

AskChem indexe 2,4 millions d'affirmations en chimie issues de 147 000 articles, chacune adossée à un DOI source et à une citation textuelle, servies aux scientifiques et aux agents d'IA via une application web, REST, un SDK et MCP. Sur AskChem-Bench, la résolution des DOI pour un lecteur GPT-5.5 est passée de 88,3 % à 100 %.

2026-07-31

4 min read

Évaluation ancrée vs. non ancrée

Pourquoi l’auto-évaluation de votre modèle d’IA échoue sur la qualité visuelle

Une nouvelle recherche introduit l’« ancrage » comme variable clé régissant un troisième axe du calcul au moment du test : le dimensionnement par interaction. Les résultats montrent qu’un instrument déterministe mesurant la disposition réelle surpasse l’évaluation VLM sur capture d’écran, corrigeant 40 % des défauts sur les diapositives denses et 74 % des défauts sur les figures académiques, alors que la métrique standard ne voit rien.

2026-07-31

3 min read

Recherche en IA

La génération vidéo devient 120 fois plus rapide sur un seul GPU : au cœur de l'avancée de Nvidia sur l'attention hybride

La SANA-Video 2.0 de Nvidia Research combine l'attention linéaire et softmax périodique dans un ratio 3:1 pour fonctionner 120 fois plus vite que Wan 2.2 sur un seul H100. La conception hybride retrouve une expressivité de plein rang tout en maintenant une inférence à 13 secondes pour un clip 720p. Les réserves : les benchmarks s'arrêtent à 720p et intègrent le changement d'attention avec des optimisations propriétaires.

2026-07-31

4 min read

Politique de l'IA

Le terrain d'entente nuancé d'Anthropic sur les modèles d'IA à poids ouverts

Amodei décrit deux scénarios cauchemardesques, la supériorité militaire autoritaire et les risques de mauvaise utilisation, et soutient que les interdictions générales des modèles à poids ouverts passent à côté du vrai problème.

2026-07-31

← PreviousPage 12 / 48 · 565 articlesNext →