Agents de codage · Le harnais à deux modèles de Devin
Payer 2 fois plus par token a rendu Fusion de Devin 9 % moins cher
Fusion de Devin exécute un modèle de frontière en principal aux côtés d'un adjoint moins cher, chacun avec son propre contexte. Les tableaux de benchmarks de Devin montrent des coûts par tâche en baisse pouvant atteindre 46 %, et un cas où un principal coûtant deux fois plus cher par token a produit une session 9 % moins chère.
Emmanuel Fabrice Omgbwa Yasse Assisté par IA
2026-09-26 · 5 min de lecture

Tous les débats sur le coût des agents de codage IA se sont livrés par token. Le harnais Fusion de Devin, disponible à partir d'aujourd'hui dans Devin Desktop et Devin CLI, tente de changer l'unité de mesure. Il exécute deux modèles au lieu d'un : un modèle de frontière comme principal, qui porte le plan et révise le travail, et un modèle moins cher comme adjoint, qui explore le code, met en œuvre les modifications, exécute les tests et rend compte. Devin recommande d'associer Fable 5.1 à SWE-2.
Devin décrit Fusion comme jusqu'à 39 % plus efficace que les autres harnais de modèles sur les principaux benchmarks de codage. Les tableaux de benchmarks, et la manière dont les économies sont comptabilisées, méritent un examen plus attentif.
Fable 5 coûte deux fois plus cher par token et termine 9 % moins cher
L'exemple le plus clair donné par Devin est une substitution au sein de son propre harnais. Remplacer Opus 4.8 par Fable 5 comme principal, en gardant le même adjoint, a produit des sessions qui coûtent en moyenne 9 % de moins tout en obtenant de meilleurs scores sur FrontierCode, selon l'article. Fable coûte environ deux fois plus cher par token.
Le tableau des adjoints fait le même constat par l'autre bout. Avec Astra comme principal, passer de GPT-5.6 Luna à SWE-2 fait grimper le prix catalogue de 0,20 $ à 0,75 $ par million de tokens, soit une hausse de 275 %, alors que Devin indique que la tâche FrontierCode terminée revient à 2,34 $ contre 2,39 $, une baisse de 2 %.
L'explication de Devin est que le prix par token mesure la mauvaise chose. Un modèle bon marché qui nécessite plus de tentatives, et dont la production doit être corrigée par le principal, peut coûter plus cher une fois la tâche terminée.
Tous les chiffres ici viennent de Devin et de ses partenaires
Les cinq lignes de benchmarks ont été exécutées avec Artificial Analysis et Vals AI, selon l'article, les économies étant mesurées par rapport au modèle de frontière unique qui réalise l'ensemble du travail.
| Benchmark | Fable 5.1 | Fusion (Fable 5.1 + SWE-2) | Astra | Fusion (Astra + SWE-2) |
|---|---|---|---|---|
| DeepSWE 1.1 | 64,3 / 14,63 $ | 63,1 / 7,88 $ (-46 %) | 67,6 / 7,88 $ | 67,3 / 4,69 $ (-40 %) |
| Terminal-Bench 4 | 57,6 / 17,46 $ | 56,1 / 13,37 $ (-23 %) | 55,6 / 10,08 $ | 50,0 / 6,06 $ (-40 %) |
| SWE-Atlas QnA | 64,8 / 7,57 $ | 65,9 / 5,00 $ (-34 %) | 61,8 / 5,72 $ | 59,4 / 3,59 $ (-37 %) |
| Vals Code Migration | 54,6 / 70,97 $ | 57,3 / 42,00 $ (-41 %) | 67,7 / 44,36 $ | 61,3 / 35,51 $ (-20 %) |
| FrontierCode 1.1 (Extended) | 63,6 / 2,68 $ | 63,5 / 1,67 $ (-38 %) | 63,1 / 2,62 $ | 63,4 / 2,34 $ (-11 %) |
Les économies sont inégales. La réduction la plus forte est de 46 % sur DeepSWE 1.1 avec Fable 5.1 et SWE-2, où le score glisse de 64,3 à 63,1. La plus faible est de 11 % sur FrontierCode 1.1 (Extended) avec Astra et SWE-2, où le score progresse légèrement de 63,1 à 63,4. Deux lignes coûtent à l'association Astra une réelle précision : Terminal-Bench 4 chute de 55,6 à 50,0 pour une économie de 40 %, et Vals Code Migration passe de 67,7 à 61,3 pour 20 %.
L'article ne cite aucune réplication indépendante, ni aucun chiffre de benchmark provenant d'une partie sans intérêt en jeu. Devin indique que Fusion tourne sur Devin Cloud depuis plusieurs mois.
Le problème du cache de prompt quand on change de modèle en cours de tâche
L'argumentaire de Devin contre le routage de modèles repose sur deux affirmations. Le prompt initial ne révèle pas la difficulté d'une tâche, car « Corrige le bug xyz » peut être un cas limite d'une ligne ou une réarchitecture, et la différence n'apparaît qu'après lecture du code. Changer de modèle en cours de tâche casse aussi les caches de prompt, ce qui reporte le coût sur le modèle coûteux.
Fusion évite le changement en gardant les deux modèles résidents. Le principal et l'adjoint s'exécutent comme des agents parallèles, chacun avec un contexte persistant et ses propres outils, échangeant des briefs, des résultats et des retours plutôt que des historiques de conversation complets, de sorte que chaque côté garde son cache intact.
L'article ne nomme aucun agent concurrent qui effectue du routage en cours de session et ne cite aucune recherche publiée sur le routage. L'argument est structurel. Devin ne rapporte aucune expérience face à un agent de routage.
Des instructions qui aident une association en pénalisent une autre
La partie de Fusion qui serait difficile à copier est le réglage autour de l'association. Devin indique qu'il ajuste le harnais pour chaque combinaison, car des instructions qui rendent une paire efficace peuvent en dégrader une autre.
- Niveau de détail du brief : avec un adjoint plus faible, Fable 5.1 rédige des briefs plus prescriptifs, dépensant des tokens du principal en amont pour éviter des cycles de révision plus tard. Avec SWE-2, il laisse davantage de détails d'implémentation à l'adjoint.
- Contestation : les adjoints plus forts sont encouragés à contester le plan du principal, ce qui, selon Devin, permet de rattraper des erreurs de planification. Laisser des adjoints plus faibles avoir des opinions nuit à la fois à la performance et au coût.
- Exploration : le travail nécessaire à la planification reste au principal, car un adjoint plus faible peut ne pas juger quelles informations comptent. Les adjoints plus forts sont autorisés à participer à l'exploration initiale.
Devin qualifie cette dernière limite de domaine de recherche actif. Si le réglage doit être refait pour chaque paire, un concurrent qui copie la conception à deux agents sans ce réglage ne reproduirait pas les chiffres.
Si les acheteurs passent au prix par tâche, les prix par token cessent de prédire la facture
La recommandation finale de Devin est que les modèles, et les combinaisons modèle-harnais, soient jugés sur le prix par tâche plutôt que sur le prix par token à partir de 2026. Prenez cela au sérieux et deux conséquences en découlent pour les achats. Le prix catalogue d'un adjoint cesse de décider de l'affaire : SWE-2 coûte 275 % de plus par token que Luna et Devin indique qu'il termine légèrement moins cher. Associer un modèle de frontière à l'exécutant le moins cher disponible perd aussi sa raison d'être, car l'exécutant le moins cher est souvent celui que le modèle coûteux doit corriger.
Rien de tout cela n'est exempt d'intérêts. Devin vend un harnais dont la valeur dépend de l'acceptation par les acheteurs d'une comptabilité par tâche, et les seules preuves à ce jour proviennent de benchmarks que ses propres partenaires ont contribué à exécuter. La comparaison qu'il vaut la peine d'attendre est celle d'un agent de routage concurrent mesuré de la même manière sur les mêmes tâches.
- Source : Paying 2x more per token made Devin's Fusion 9% cheaper — 2026-09-11
L'essentiel de la tech en 3 minutes chaque matin
Un email, chaque jour ouvré, avec ce qui compte vraiment en IA et en tech.