SevenTnewS

codage agentique

9 published articles

Laboratoires & Recherche5 min read

IA / Recherche en codage agentique

Blast Radius enterre le contexte mort. Aucun des 450 corps n'est revenu.

Un nouvel article arXiv, Blast Radius, traite le contexte agentique gaspillé comme de la matière morte et l'enterre de manière réversible : 17 à 26 % d'économies de jetons sur sept modèles OpenAI, 450 contextes archivés, zéro rappel. L'objectif plus ambitieux de l'article est de rendre le codage agentique durable, un jeton récupéré à la fois.

2026-08-19

Agents IA4 min read

Codage agentique & gonflement des prompts

Mémoire catastrophique : pourquoi les fichiers CLAUDE.md grossissent de 226 % et ne rétrécissent jamais

Une étude arXiv portant sur 1 867 dépôts constate que les fichiers d'instructions de codage agentique comme CLAUDE.md triplent de taille au cours de leur vie, car supprimer une ligne risque d'entraîner des régressions une fois sa justification perdue. Les auteurs nomment ce phénomène « mémoire catastrophique » et montrent que documenter le raisonnement réduit les instructions superflues de 99,3 %.

2026-08-15

xAI / GrokFeatured4 min read

Intelligence artificielle

Grok 4.6 fait match nul avec GPT-5.6 Sol à 61, puis les scores par composante divergent

Le Grok 4.6 de xAI fait match nul avec GPT-5.6 Sol à 61 sur l'indice Artificial Analysis Intelligence, un composite de neuf benchmarks. La répartition est déséquilibrée : victoires sur le travail de connaissance et la plupart des tests de code, défaites sur DeepSWE et Terminal-Bench. Disponible dès maintenant dans Cursor et Grok Build, à partir de 2 $ par million de jetons d'entrée.

2026-08-13

IDE IA5 min read

IDE IA

Cursor attaque les coûts des agents avec un plan Inde à 649 ₹ et un routeur de modèles

La mise à jour de juillet de Cursor ajoute un plan Inde à 649 ₹ par mois et un mode Auto qui route les requêtes vers des modèles moins chers, ainsi qu'une revue complète des PR sur iPhone et iPad et des agents qui travaillent dans Slack. Cette version porte avant tout sur le contrôle des coûts du codage agentique.

2026-08-05

Qwen / AlibabaFeatured5 min read

IA open source

Qwen3.8-Max a battu 458 équipes humaines en 24 heures, en travaillant seul

Qwen3.8-Max a battu 458 des 526 équipes humaines lors d'un concours de 24 heures en travaillant seul, et Alibaba mettra ses poids en open source la semaine prochaine. Chaque chiffre est pour l'instant auto-déclaré, ce qui explique précisément pourquoi les affirmations d'autonomie méritent d'être examinées de près.

2026-08-03

Tests & BenchmarksFeatured2 min read

Analyse de benchmark

Sur SWE-bench Verified, les meilleurs modèles atteignent 96 %. Sur du code d'entreprise privé, ils dépassent à peine 23 %

SWE-bench Verified donne l'impression que les modèles de pointe sont proches de résoudre le génie logiciel réel, avec des scores supérieurs à 95 %. SWE-bench Pro, exécuté sur des dépôts d'entreprise privés, fait chuter ces mêmes modèles à 23 % ou moins, révélant à quel point le score Verified dépendait de l'exposition aux données publiques.

2026-08-02

IDE IA2 min read

Lancement de produit

Le plan indien de Cursor à 649 INR par mois inclut un routeur de modèles qui sélectionne le modèle le moins cher pour chaque tâche

Cursor Start offre aux développeurs indiens une tarification locale avec UPI, tandis que Cursor Router permet aux équipes de contrôler le compromis coût-intelligence par requête. Deux fonctionnalités qui abaissent la barrière et optimisent les dépenses.

2026-08-01

IA5 min read

Alibaba Qoder

Le code IA a deux fois plus de risques de contenir des bugs. Qoder y remédie pendant la session

Qoder Security intègre un ingénieur en sécurité dédié à chaque session de codage IA, détectant les vulnérabilités au moment où le code est écrit, pas des jours plus tard lors du déploiement.

2026-07-30

CybersécuritéFeatured4 min read

Sécurité du codage IA

L'angle mort du code généré par IA qu'Alibaba corrige en cours de phrase

Alibaba Cloud lance Qoder Security, un système de revue de code en session conçu pour détecter les vulnérabilités pendant le développement plutôt qu'à l'étape CI. La plateforme revendique 80% de faux positifs en moins et des cycles de correction de quelques heures.

2026-07-26