SevenTnewS

agents de codage

9 published articles

Google DeepMindFeatured3 min read

Le cheval de trait de Google, plus étoffé dans la mise à jour 3.7

Gemini 3.7 Flash divise son prix par deux, puis le justifie

Le Gemini 3.7 Flash de Google sort à la moitié du prix de lancement du 3.6 Flash, tout en revendiquant des gains sur les benchmarks de codage, de développement web et de travail cognitif. La sortie intervient trois semaines après le Flash précédent et s'accompagne d'un nouvel argument prix-performance pour les développeurs d'agents.

2026-08-16

IA4 min read

Multimodal / Open Source

Le pack de plugins Qwen donne à votre agent de codage des yeux, des mains et une mémoire vidéo

L'équipe Qwen d'Alibaba a publié Qwen-MM-Plugins, une boîte à outils Apache-2.0 qui donne aux agents de codage des skills multimodaux natifs : lecture d'images et de vidéos en résolution dynamique, OCR, grounding, ASR, mémoire vidéo longue, génération vidéo et contrôle en client léger de Blender et FreeCAD. Un seul script l'installe sur Claude Code, Codex, Qoder, OpenClaw, Qwen Code et Gemini CLI.

2026-08-15

Agents IA7 min read

Sécurité du terminal

Le piège « $HOME » : les agents de codage IA ont besoin de sandboxes, pas de prompts « allow ? »

Le sandbox terminal de Qoder bloque près d'une centaine de commandes d'agents destructrices chaque jour. Les cas derrière ces blocages expliquent pourquoi les prompts « allow ? » échouent : un dossier de projet nommé $HOME, un nettoyage qui ciblait /root, et un clic qui a failli coûter un disque entier.

2026-08-13

IDE IA4 min read

Alibaba / IDE IA

Pourquoi Qoder 1.0 a renoncé à l'IDE à espace de travail unique

Qoder 1.0 sépare les frontières d'espace de travail, d'exécution, d'artefacts et de livraison dans des worktrees isolés afin que les tâches d'agents parallèles cessent d'entrer en collision. Les données A/B d'Alibaba indiquent que son moteur de mémoire délimité a réduit les jetons d'entrée de 40 %.

2026-08-04

IA5 min read

Recherche en IA

Faible coût, pas d'échec : un correctif pour les agents de codage à 35 % du prix

CodeRescue, un système d'orientation de récupération pour les agents de code, utilise le retour d'exécution pour décider quand réessayer avec des modèles bon marché ou escalader vers des modèles coûteux. Une couche de contrôle de risque conforme permet aux opérateurs de définir des objectifs de coût sans réentraînement, atteignant des taux de résolution quasi parfaits à 35 % du coût de l'escalade systématique.

2026-07-25

Tests & BenchmarksFeatured3 min read

Codage agentique

Comment Grok 4.5 a pris la tête du SWE Marathon, et ce que cela signifie pour les agents de codage

Grok 4.5 mène désormais le classement du SWE Marathon, battant Claude 4 Opus et GPT-5. Le benchmark teste de véritables compétences en génie logiciel : corrections de bugs, ajouts de fonctionnalités et compréhension du code dans des dépôts réels. Ce résultat redessine le paysage concurrentiel des agents de codage IA.

2026-07-20

Mistral AI3 min read

Agents IA

Agents de codage Mistral : votre ordinateur portable n'est plus nécessaire, sessions parallèles sans surveillance

Mistral déplace les agents de codage vers le cloud, permettant l'exécution parallèle et asynchrone de tâches via le nouveau modèle Mistral Medium 3.5. La mise à jour introduit des agents distants dans Mistral Vibe et Le Chat, ainsi qu'un mode Work pour les tâches multi-étapes, tout en gardant une supervision humaine pour les actions sensibles.

2026-07-12

IAFeatured5 min read

Analyse des benchmarks d'agents

ProgramBench : tous les IA publiques obtiennent 0% au test de codage le plus difficile

ProgramBench met au défi les agents IA de reconstruire des programmes à partir de binaires seuls, sans code source ni description de problème. Tous les modèles publics échouent à résoudre complètement une tâche, exposant des faiblesses en exploration, architecture et jugement d'arrêt. Le benchmark est un test de résistance pour les agents de codage au-delà des workflows basés sur des correctifs.

2026-06-29

Tests & BenchmarksFeatured3 min read

Performances

Gemma 4 tourne presque 90 % plus vite dans Ollama 0.31 avec la prédiction multi-tokens

Ollama 0.31 introduit la prédiction multi-tokens pour Gemma 4 sur Apple Silicon, atteignant près de 90 % de génération de tokens plus rapide sur les benchmarks de codage. L'accélération provient d'un modèle de brouillon auto-ajusté et d'un noyau MLX personnalisé qui élimine les lectures redondantes de poids.

2026-06-29