codage agentique
9 published articles
IA / Recherche en codage agentique
Blast Radius enterre le contexte mort. Aucun des 450 corps n'est revenu.
Un nouvel article arXiv, Blast Radius, traite le contexte agentique gaspillé comme de la matière morte et l'enterre de manière réversible : 17 à 26 % d'économies de jetons sur sept modèles OpenAI, 450 contextes archivés, zéro rappel. L'objectif plus ambitieux de l'article est de rendre le codage agentique durable, un jeton récupéré à la fois.
2026-08-19
Codage agentique & gonflement des prompts
Mémoire catastrophique : pourquoi les fichiers CLAUDE.md grossissent de 226 % et ne rétrécissent jamais
Une étude arXiv portant sur 1 867 dépôts constate que les fichiers d'instructions de codage agentique comme CLAUDE.md triplent de taille au cours de leur vie, car supprimer une ligne risque d'entraîner des régressions une fois sa justification perdue. Les auteurs nomment ce phénomène « mémoire catastrophique » et montrent que documenter le raisonnement réduit les instructions superflues de 99,3 %.
2026-08-15
Intelligence artificielle
Grok 4.6 fait match nul avec GPT-5.6 Sol à 61, puis les scores par composante divergent
Le Grok 4.6 de xAI fait match nul avec GPT-5.6 Sol à 61 sur l'indice Artificial Analysis Intelligence, un composite de neuf benchmarks. La répartition est déséquilibrée : victoires sur le travail de connaissance et la plupart des tests de code, défaites sur DeepSWE et Terminal-Bench. Disponible dès maintenant dans Cursor et Grok Build, à partir de 2 $ par million de jetons d'entrée.
2026-08-13
IDE IA
Cursor attaque les coûts des agents avec un plan Inde à 649 ₹ et un routeur de modèles
La mise à jour de juillet de Cursor ajoute un plan Inde à 649 ₹ par mois et un mode Auto qui route les requêtes vers des modèles moins chers, ainsi qu'une revue complète des PR sur iPhone et iPad et des agents qui travaillent dans Slack. Cette version porte avant tout sur le contrôle des coûts du codage agentique.
2026-08-05
IA open source
Qwen3.8-Max a battu 458 équipes humaines en 24 heures, en travaillant seul
Qwen3.8-Max a battu 458 des 526 équipes humaines lors d'un concours de 24 heures en travaillant seul, et Alibaba mettra ses poids en open source la semaine prochaine. Chaque chiffre est pour l'instant auto-déclaré, ce qui explique précisément pourquoi les affirmations d'autonomie méritent d'être examinées de près.
2026-08-03
Analyse de benchmark
Sur SWE-bench Verified, les meilleurs modèles atteignent 96 %. Sur du code d'entreprise privé, ils dépassent à peine 23 %
SWE-bench Verified donne l'impression que les modèles de pointe sont proches de résoudre le génie logiciel réel, avec des scores supérieurs à 95 %. SWE-bench Pro, exécuté sur des dépôts d'entreprise privés, fait chuter ces mêmes modèles à 23 % ou moins, révélant à quel point le score Verified dépendait de l'exposition aux données publiques.
2026-08-02
Lancement de produit
Le plan indien de Cursor à 649 INR par mois inclut un routeur de modèles qui sélectionne le modèle le moins cher pour chaque tâche
Cursor Start offre aux développeurs indiens une tarification locale avec UPI, tandis que Cursor Router permet aux équipes de contrôler le compromis coût-intelligence par requête. Deux fonctionnalités qui abaissent la barrière et optimisent les dépenses.
2026-08-01
Alibaba Qoder
Le code IA a deux fois plus de risques de contenir des bugs. Qoder y remédie pendant la session
Qoder Security intègre un ingénieur en sécurité dédié à chaque session de codage IA, détectant les vulnérabilités au moment où le code est écrit, pas des jours plus tard lors du déploiement.
2026-07-30
Sécurité du codage IA
L'angle mort du code généré par IA qu'Alibaba corrige en cours de phrase
Alibaba Cloud lance Qoder Security, un système de revue de code en session conçu pour détecter les vulnérabilités pendant le développement plutôt qu'à l'étape CI. La plateforme revendique 80% de faux positifs en moins et des cycles de correction de quelques heures.
2026-07-26