Laboratoires & Recherche
OpenAI, Anthropic, Google DeepMind, Meta AI et publications.
114 published articles
Google AI
Désactiver le filigrane de Gemini ne rend pas le contenu intraçable
Les contenus IA de Gemini et Flow peuvent désormais abandonner leur badge étincelle visible. Les marqueurs invisibles SynthID et C2PA restent en place, la vérification fonctionne donc toujours. Le hic : cela ne fonctionne que pour ceux qui pensent à vérifier.
2026-08-23
Transparence IA
Le filigrane invisible de Claude arrive. Une réécriture complète l'efface
Anthropic ajoute un filigrane invisible aux futurs modèles Claude pour respecter les règles de l'AI Act européen sur le marquage des contenus générés par l'IA. Il est gratuit et intraçable, mais il ignore le code exact, les passages courts et les textes entièrement réécrits.
2026-08-21
Recherche en IA
Muon grokke l'addition modulaire plus vite, puis ses solutions s'effondrent
Les transformeurs entraînés par Muon grokkent l'addition modulaire plus vite que AdamW, puis perdent la solution dans toutes les configurations testées. L'article attribue l'effondrement à l'interface représentation-lecture, où geler l'un ou l'autre groupe de paramètres l'empêche. L'analyse de Fourier montre que le circuit de la tâche survit et se trouve simplement mis en minorité.
2026-08-19
Fisher-R1 | Test d'hypothèses
Les agents IA produisent des statistiques sans faille et tirent pourtant de mauvaises conclusions
Les agents qui automatisent les tests d'hypothèses peuvent exécuter des analyses sans faille tout en parvenant à de mauvaises conclusions, car la plupart des benchmarks ne vérifient jamais si la valeur p est valide. Un benchmark de 425 tâches quantifie cet écart, et un modèle open-weight entraîné par RL en comble une partie.
2026-08-19
IA / Recherche en codage agentique
Blast Radius enterre le contexte mort. Aucun des 450 corps n'est revenu.
Un nouvel article arXiv, Blast Radius, traite le contexte agentique gaspillé comme de la matière morte et l'enterre de manière réversible : 17 à 26 % d'économies de jetons sur sept modèles OpenAI, 450 contextes archivés, zéro rappel. L'objectif plus ambitieux de l'article est de rendre le codage agentique durable, un jeton récupéré à la fois.
2026-08-19
Recherche en IA
Un patron IA qui ignore les réponses pousse son subalterne dans un état « alien »
Un nouvel article sur arXiv révèle que les agents IA se comportent différemment en interaction qu'en isolation. Un agent patron qui ignore les réponses de son subalterne le pousse dans un état « alien », et lorsque le patron écoute, les deux évoluent ensemble. Ce résultat fait de la livraison des messages une décision de conception pour les systèmes multi-agents.
2026-08-19
Recherche en IA
Des chaînes de pensée plus longues butent sur un mur. ThinkRetrieve injecte le correctif en cours de raisonnement
Le test-time scaling séquentiel atteint souvent des rendements décroissants, voire négatifs, affirme une nouvelle prépublication. ThinkRetrieve récupère des exemples résolus en cours de raisonnement et les injecte dans la trace, rapportant des gains relatifs allant jusqu'à 60 % sur AIME 2025 sur cinq petits modèles de raisonnement.
2026-08-18
Recherche sur la conduite autonome
XCoT-VLA : une IA de conduite qui raisonne en six tokens, pas en un paragraphe
XCoT-VLA remplace le raisonnement descriptif en chaîne dans les modèles de conduite vision-langage-action par 2 à 6 tokens exécutables, réduisant l’erreur de trajectoire tout en restant dans les budgets de planification en temps réel. Le compromis : un raisonnement qui se compresse bien cesse de ressembler à une explication humaine.
2026-08-18
Sûreté de l'IA
Qwen3.8-27B abliterated : les refus tombent à 0 %, les benchmarks bougent à peine
Une version abliterated et quantisée en FP8 de Qwen3.8-27B refuse 0 % des prompts nuisibles sur AdvBench, contre 99 %, tandis que les benchmarks généraux restent dans une marge de 1,3 point. La fiche du modèle documente la méthode avec un niveau de détail inhabituel. Les mises en garde méritent une attention égale.
2026-08-16
Agents IA · Open Source
DeepSeek lance un harness d'agents où même le modèle est un plugin
DeepSeek a publié DeepSeek Harness, un runtime d'agents open source où modèles, outils, sandboxes et UI sont tous des plugins Cordis. Des journaux de session en écriture seule et un mode minimal à deux outils révèlent une ambition plus discrète : des exécutions d'agents auditées et reproductibles.
2026-08-16
Le cheval de trait de Google, plus étoffé dans la mise à jour 3.7
Gemini 3.7 Flash divise son prix par deux, puis le justifie
Le Gemini 3.7 Flash de Google sort à la moitié du prix de lancement du 3.6 Flash, tout en revendiquant des gains sur les benchmarks de codage, de développement web et de travail cognitif. La sortie intervient trois semaines après le Flash précédent et s'accompagne d'un nouvel argument prix-performance pour les développeurs d'agents.
2026-08-16
IA open source
Qwen 3.8-Max : le modèle le plus puissant d'Alibaba est désormais téléchargeable gratuitement
Alibaba met en open source Qwen 3.8-Max, son modèle le plus performant jamais conçu : un MoE de 2.4 billions de paramètres qui bat GPT-5.6 Sol sur SWE-bench Pro, PaperBench et IFBench. Nous décortiquons les réserves sur les benchmarks et ce qu'un modèle vedette ouvert à 95B actifs signifie pour les développeurs.
2026-08-16