Agentes de código · El arnés de dos modelos de Devin
Pagar el doble por token hizo que Fusion de Devin fuera un 9% más barato
Fusion de Devin ejecuta un modelo líder de frontera junto a un acompañante más barato, cada uno con su propio contexto. Las tablas de benchmarks de Devin muestran caídas de los costes por tarea de hasta el 46%, y un caso en el que un líder que cuesta el doble por token produjo una sesión un 9% más barata.
Emmanuel Fabrice Omgbwa Yasse Asistido por IA
2026-09-26 · 5 min de lectura

Toda discusión sobre el coste de los agentes de código con IA se ha librado por token. El arnés Fusion de Devin, disponible desde hoy en Devin Desktop y Devin CLI, intenta cambiar la unidad. Ejecuta dos modelos en lugar de uno: un modelo de frontera como líder, que es dueño del plan y revisa el trabajo, y un modelo más barato como acompañante, que explora el código, implementa cambios, ejecuta pruebas e informa de vuelta. Devin recomienda emparejar Fable 5.1 con SWE-2.
Devin describe Fusion como hasta un 39% más eficiente que otros arneses de modelos en los principales benchmarks de código. Las tablas de benchmarks, y la forma en que se contabilizan los ahorros, merecen una lectura más atenta.
Fable 5 cuesta el doble por token y termina un 9% más barato
El ejemplo más claro de Devin es una sustitución dentro de su propio arnés. Reemplazar Opus 4.8 por Fable 5 como líder, manteniendo el mismo acompañante, produjo sesiones que costaron de media un 9% menos y que obtuvieron mejor puntuación en FrontierCode, según la publicación. Fable cuesta aproximadamente el doble por token.
La tabla del acompañante plantea el mismo punto desde el otro lado. Frente a Astra como líder, pasar de GPT-5.6 Luna a SWE-2 eleva el precio de lista de $0.20 a $0.75 por millón de tokens, un aumento del 275%, mientras que Devin informa de la tarea FrontierCode terminada en $2.34 frente a $2.39, una caída del 2%.
La explicación de Devin es que el precio por token mide lo que no debe. Un modelo barato que necesita más intentos, y cuya salida el líder tiene que corregir, puede costar más una vez terminada la tarea.
Todos los números aquí provienen de Devin y sus socios
Las cinco filas de benchmarks se ejecutaron con Artificial Analysis y Vals AI, según la publicación, con los ahorros medidos frente al único modelo de frontera que hace todo el trabajo.
| Benchmark | Fable 5.1 | Fusion (Fable 5.1 + SWE-2) | Astra | Fusion (Astra + SWE-2) |
|---|---|---|---|---|
| DeepSWE 1.1 | 64.3 / $14.63 | 63.1 / $7.88 (-46%) | 67.6 / $7.88 | 67.3 / $4.69 (-40%) |
| Terminal-Bench 4 | 57.6 / $17.46 | 56.1 / $13.37 (-23%) | 55.6 / $10.08 | 50.0 / $6.06 (-40%) |
| SWE-Atlas QnA | 64.8 / $7.57 | 65.9 / $5.00 (-34%) | 61.8 / $5.72 | 59.4 / $3.59 (-37%) |
| Vals Code Migration | 54.6 / $70.97 | 57.3 / $42.00 (-41%) | 67.7 / $44.36 | 61.3 / $35.51 (-20%) |
| FrontierCode 1.1 (Extended) | 63.6 / $2.68 | 63.5 / $1.67 (-38%) | 63.1 / $2.62 | 63.4 / $2.34 (-11%) |
Los ahorros son desiguales. El mayor recorte es del 46% en DeepSWE 1.1 con Fable 5.1 y SWE-2, donde la puntuación baja de 64.3 a 63.1. El menor es del 11% en FrontierCode 1.1 (Extended) con Astra y SWE-2, donde la puntuación sube ligeramente de 63.1 a 63.4. Dos filas le cuestan al emparejamiento con Astra exactitud real: Terminal-Bench 4 cae de 55.6 a 50.0 por un ahorro del 40%, y Vals Code Migration baja de 67.7 a 61.3 por un 20%.
La publicación no cita ninguna replicación independiente, ni ninguna cifra de benchmark de una parte sin nada que ganar con ello. Devin dice que Fusion ha funcionado en Devin Cloud durante varios meses.
El problema de la caché de prompts al cambiar de modelo a mitad de tarea
El argumento de Devin contra el enrutamiento de modelos se apoya en dos afirmaciones. El prompt inicial no revela cuán difícil es una tarea, ya que "Fix xyz bug" puede ser un caso límite de una línea o una rearquitectura, y la diferencia solo aparece después de que alguien lea el código. Cambiar de modelo a mitad de tarea también rompe las cachés de prompts, trasladando el coste de vuelta al modelo caro.
Fusion evita el cambio manteniendo ambos modelos residentes. El líder y el acompañante se ejecutan como agentes paralelos, cada uno con un contexto persistente y sus propias herramientas, intercambiando informes, resultados y retroalimentación en lugar de historiales completos de conversación, de modo que cada lado mantiene su caché intacta.
La publicación no nombra ningún agente rival que enrute a mitad de sesión y no cita ninguna investigación publicada sobre enrutamiento. El argumento es estructural. Devin no informa de ningún experimento contra un agente de enrutamiento.
Instrucciones que ayudan a un emparejamiento perjudican a otro
La parte de Fusion que sería difícil de copiar es el ajuste en torno al emparejamiento. Devin dice que ajusta el arnés por combinación, porque las instrucciones que hacen eficiente a un par pueden empeorar a otro.
- Detalle del informe: con un acompañante más débil, Fable 5.1 redacta informes más prescriptivos, gastando tokens del líder pronto para evitar rondas de revisión posteriores. Con SWE-2, deja más detalle de implementación al acompañante.
- Cuestionamiento: se anima a los acompañantes más fuertes a desafiar el plan del líder, lo que según Devin detecta errores de planificación. Permitir que los acompañantes más débiles opinen perjudica tanto el rendimiento como el coste.
- Exploración: el trabajo necesario para la planificación se queda con el líder, porque un acompañante más débil puede no juzgar qué información importa. Se permite a los acompañantes más fuertes participar en la exploración inicial.
Devin califica ese último límite como un área activa de su investigación. Si el ajuste tiene que rehacerse por cada par, un competidor que copie el diseño de dos agentes sin él no reproduciría los números.
Si los compradores cambian al precio por tarea, los precios por token dejan de predecir la factura
La recomendación final de Devin es que los modelos, y las combinaciones de modelo y arnés, se juzguen por el precio por tarea en lugar del precio por token a partir de 2026. Tómese en serio y de ahí se derivan dos cosas para las compras. El precio de lista de un acompañante deja de decidir el acuerdo: SWE-2 cuesta un 275% más por token que Luna y Devin informa de que termina algo más barato. Emparejar un modelo de frontera con el ejecutor más barato disponible también pierde su razón de ser, ya que el ejecutor más barato suele ser el que el modelo caro tiene que corregir.
Nada de esto está libre de intereses. Devin vende un arnés cuyo valor depende de que los compradores acepten la contabilidad por tarea, y la única evidencia hasta ahora proviene de benchmarks que sus propios socios ayudaron a ejecutar. La comparación que merece la pena esperar es un agente de enrutamiento rival medido de la misma forma en las mismas tareas.
- Fuente : Paying 2x more per token made Devin's Fusion 9% cheaper — 2026-09-11
Lo esencial de la tecnología en 3 minutos cada mañana
Un correo, cada día laborable, con lo que realmente importa en IA y tecnología.