SevenTnewS

Agents IA

74 published articles

Agents IA5 min read

Outils de design

Open Design 0.18.0 met fin à la réunion « Est-ce la dernière version ? »

Open Design 0.18.0 propose un espace de travail d'équipe partagé avec des miroirs en lecture seule en direct et permet à Codex d'appeler le moteur de design sans interface. 115 pull requests de 22 contributeurs ont été fusionnées en deux jours. Voici ce qui a changé et la tendance des outils d'agents à laquelle cela correspond.

2026-08-21

Tests & Benchmarks4 min read

Benchmark de raisonnement financier

Les LLM connaissent les formules comptables. FinIndices montre qu'ils ne savent pas les appliquer

Les LLM peuvent réciter des formules comptables, mais FinIndices, un benchmark construit sur de véritables états financiers chinois, montre qu'ils peinent à les appliquer. La précision de Gemini-3.1-Pro est passée de 70,70 % à 38,22 % lorsque les indices de formules ont été retirés, et la génération de tableaux a activement dégradé le raisonnement des modèles.

2026-08-20

Agents IA4 min read

Mémoire des agents

TEPA : pour les agents IA, une mémoire obsolète est pire que l'absence de mémoire

La mémoire des agents a un problème de falsifiabilité, soutient un nouveau préprint arXiv : les faits obsolètes restent récupérables et polluent le prompt. Son mécanisme TEPA révoque les mémoires dépassées, et lors des tests de dérive, la mémoire naïve a obtenu un score inférieur à celui de l'absence de mémoire (0.210 contre 0.309), tandis que TEPA a atteint 0.950.

2026-08-19

Laboratoires & Recherche4 min read

Recherche en IA

Un patron IA qui ignore les réponses pousse son subalterne dans un état « alien »

Un nouvel article sur arXiv révèle que les agents IA se comportent différemment en interaction qu'en isolation. Un agent patron qui ignore les réponses de son subalterne le pousse dans un état « alien », et lorsque le patron écoute, les deux évoluent ensemble. Ce résultat fait de la livraison des messages une décision de conception pour les systèmes multi-agents.

2026-08-19

DeepSeek4 min read

Agents IA · Open Source

DeepSeek lance un harness d'agents où même le modèle est un plugin

DeepSeek a publié DeepSeek Harness, un runtime d'agents open source où modèles, outils, sandboxes et UI sont tous des plugins Cordis. Des journaux de session en écriture seule et un mode minimal à deux outils révèlent une ambition plus discrète : des exécutions d'agents auditées et reproductibles.

2026-08-16

Qwen / Alibaba5 min read

IA open source

Qwen 3.8-Max : le modèle le plus puissant d'Alibaba est désormais téléchargeable gratuitement

Alibaba met en open source Qwen 3.8-Max, son modèle le plus performant jamais conçu : un MoE de 2.4 billions de paramètres qui bat GPT-5.6 Sol sur SWE-bench Pro, PaperBench et IFBench. Nous décortiquons les réserves sur les benchmarks et ce qu'un modèle vedette ouvert à 95B actifs signifie pour les développeurs.

2026-08-16

Agents IA4 min read

Codage agentique & gonflement des prompts

Mémoire catastrophique : pourquoi les fichiers CLAUDE.md grossissent de 226 % et ne rétrécissent jamais

Une étude arXiv portant sur 1 867 dépôts constate que les fichiers d'instructions de codage agentique comme CLAUDE.md triplent de taille au cours de leur vie, car supprimer une ligne risque d'entraîner des régressions une fois sa justification perdue. Les auteurs nomment ce phénomène « mémoire catastrophique » et montrent que documenter le raisonnement réduit les instructions superflues de 99,3 %.

2026-08-15

Cybersécurité4 min read

Cybersécurité

Les chasseurs de bugs IA de Microsoft s'apprêtent à alourdir Patch Tuesday

Le rapport de juillet 2026 de la Secure Future Initiative montre que MDASH, le scanner agentique de Microsoft, quitte les benchmarks pour Windows, Azure et les flux d'identité, les correctifs trouvés par l'IA étant appelés à alourdir chaque Patch Tuesday.

2026-08-15

Agents IA4 min read

Agents IA

Quand les compétences des agents se retournent contre eux, SkillProx les élaguent comme une descente de gradient

Les compétences étaient censées rendre les agents plus intelligents, mais chaque correctif qu'ils accumulent peut les rendre moins intelligents. SkillProx exécute une boucle avant-arrière inspirée du gradient proximal qui diagnostique, annule et supprime. Résultat : un gain moyen en précision de 3,0 points par rapport à la baseline à base de gradient la plus solide.

2026-08-14

xAI / Grok4 min read

Agents IA

Grok Bot s'attaque aux 10 derniers % du travail que la plupart des IA laissent inachevé.

Grok Bot, le nouveau produit agent de xAI, tourne sur son propre ordinateur cloud, se connecte aux outils que vous utilisez déjà, apprend vos flux de travail en vous regardant les faire une fois, et termine les tâches de bout en bout. Le pitch derrière : la plupart des IA s'arrêtent à 90 %.

2026-08-14

Meta AI3 min read

IA open source

Le Muse Glimmer 30B de Meta arrive en premier sur Apple Silicon, le support NVIDIA suivra

Meta a publié Muse Glimmer, un modèle multimodal à poids ouverts de 30B conçu pour les charges de travail d'agents, et Ollama l'a diffusé pour Apple Silicon le même jour. DFlash le rend 1,5 à 1,8 fois plus rapide sur les Mac. Les supports NVIDIA et AMD suivront dans les prochains jours.

2026-08-13

Agents IA7 min read

Sécurité du terminal

Le piège « $HOME » : les agents de codage IA ont besoin de sandboxes, pas de prompts « allow ? »

Le sandbox terminal de Qoder bloque près d'une centaine de commandes d'agents destructrices chaque jour. Les cas derrière ces blocages expliquent pourquoi les prompts « allow ? » échouent : un dossier de projet nommé $HOME, un nettoyage qui ciblait /root, et un clic qui a failli coûter un disque entier.

2026-08-13

← PreviousPage 1 / 7 · 74 articlesNext →