SevenTnewS

Agentes de IA

El enjambre de Cursor reconstruyó SQLite desde cero. Mismos resultados, facturas radicalmente distintas

El rediseñado enjambre de agentes de Cursor reconstruyó SQLite en Rust solo a partir de su manual y superó la suite de verificación completa, reduciendo los conflictos de fusión de más de 70.000 a menos de 1.000. Cada combinación de modelos ofreció una calidad similar a precios muy distintos, y esa brecha es la historia.

Emmanuel Fabrice Omgbwa Yasse Asistido por IA

2026-08-05 · 6 min de lectura

El enjambre de Cursor reconstruyó SQLite desde cero. Mismos resultados, facturas radicalmente distintas

El enjambre de agentes de Cursor implementó el manual de SQLite de 835 páginas en Rust desde una página en blanco, sin código fuente, sin suites de pruebas, sin binario y sin internet. Fue evaluado con sqllogictest, la suite del proyecto compuesta por millones de consultas con respuestas conocidas, y nunca se le informó de que la suite existía. Las cuatro configuraciones del arnés rediseñado terminaron validando el 100% de la misma.

El experimento compara los arneses antiguo y nuevo en la misma tarea, con los mismos modelos y el mismo presupuesto de tiempo. El nuevo superó al antiguo en todas las configuraciones. Con Grok 4.5 en ambos roles alcanzó el 80% en cuatro horas, mientras que el enjambre antiguo se estancó y fue pausado antes de que terminara su segunda hora. Cursor advierte que las tendencias importan más que las lecturas individuales: algunos agentes obtienen puntuaciones bajas durante horas antes de un repunte tardío, otros alcanzan un pico temprano y se estabilizan.

El impuesto de la coordinación: 70.000 conflictos

Los datos de actividad parecen productividad hasta que se comparan con los resultados. La ejecución antigua con Grok 4.5 realizó 68.000 commits en sus dos primeras horas, unas 70 veces el ritmo de la nueva ejecución, y acumuló más de 70.000 conflictos de fusión, acelerando en lugar de estabilizarse. La nueva ejecución registró menos de mil conflictos en cuatro horas. El archivo más disputado de la ejecución antigua acumuló 7.771 conflictos de 1.173 agentes distintos. El archivo más activo de la nueva ejecución tuvo 47.

El código final muestra la misma brecha. La ejecución antigua se extendió por 54 crates de Rust, incluidos tres paquetes SQL separados, la firma de dos planificadores construyendo silenciosamente lo mismo en diferentes rincones del código. Cursor llama a esto cerebro dividido. La nueva ejecución se asentó en nueve crates y nunca añadió otro. En la mezcla Fable 5, el arnés antiguo necesitó 64.305 líneas de código del motor para pasar la suite; el nuevo lo hizo en 9.908. En la mezcla Opus: 19.013 líneas al 97%, frente a 4.645 al 100%.

El ritmo impone la ingeniería. El enjambre Browser anterior alcanzó un pico de casi 1.000 commits por hora en Git; el nuevo sistema alcanza casi 1.000 por segundo en un sistema de control de versiones que Cursor construyó desde cero.

La mayoría de las correcciones que lo rodean son de proceso, no de inteligencia del modelo. Un tercer agente neutral resuelve los conflictos de fusión, como lo haría una cola de fusión humana. Los trabajadores pueden marcar megarchivos sobredimensionados, bloqueando nuevos commits hasta que otro agente divida el archivo. Las decisiones de diseño van a documentos compartidos a los que el código hace referencia en tiempo de compilación; cuando dos planificadores se contradicen, una reconciliación fusiona los documentos y las referencias propagan la resolución hacia abajo. Los agentes pueden incluso hacer cambios de ruptura deliberados fuera de su competencia si dejan un comentario, y cada agente que se topa con las consecuencias lee el razonamiento. Un modo de fallo que Cursor nombra es la osificación: los agentes habían aprendido a no tocar el código crítico incluso cuando necesitaba cambiar.

Dónde divergen las facturas

El hallazgo económico es el que vale la pena tomar prestado. Cada combinación de modelos produjo una calidad similar, según Cursor, mientras que los costos variaron enormemente. La ejecución que usó GPT-5.5 para ambos roles facturó $9.373 solo en trabajadores. Una ejecución en solitario de GPT-5.5 costó $1.339. A las cuatro horas, las nuevas ejecuciones se situaron entre el 73% y el 85%, las antiguas entre el 11% y el 77%, y cada nueva configuración terminó finalmente en el 100%.

Los trabajadores consumieron al menos el 69% de los tokens en cada ejecución, más del 90% en la mayoría, pero los tokens de los planificadores cuestan más. En la combinación de Opus 4.8 y Composer 2.5, Opus produjo una pequeña fracción de los tokens y alrededor de dos tercios del costo. La elección del modelo por sí sola no fija la factura: el planificador Fable 5 facturó ligeramente menos que el planificador Opus 4.8 a pesar de un precio por token aproximadamente el doble, porque usó muchos menos tokens de planificación. Luego sus trabajadores consumieron varias veces más tokens, y la ejecución costó notablemente más.

Pocos pasos en una tarea grande necesitan inteligencia de frontera: la descomposición inicial, las decisiones de diseño, ciertos arbitrajes. Una vez que un planificador de primer nivel ha convertido la ambigüedad en una instrucción explícita, los modelos más baratos solo necesitan ejecutarla. El mismo instinto aparece en otras partes de la ingeniería de agentes. Un sistema de enrutamiento llamado CodeRescue utiliza la retroalimentación de ejecución para decidir cuándo un modelo barato debe reintentar, alcanzando tasas de resolución casi perfectas al 35% del costo de la escalada sistemática.

Cómo se compararon las cuatro configuraciones, según informó Cursor:

PlanificadorTrabajadorResultado informado
GPT-5.5GPT-5.5Solo los trabajadores facturaron $9.373
Grok 4.5Grok 4.580% en sqllogictest en cuatro horas; el arnés antiguo se estancó antes de la segunda hora
Opus 4.8Composer 2.5El planificador asumió alrededor de dos tercios del costo; finalizó al 100% con 4.645 líneas del motor
Fable 5Composer 2.5Alrededor de dos tercios de la suite en la primera hora; finalizó al 100% con 9.908 líneas del motor

La especificación se convierte en la unidad de trabajo

Cada salto en la capacidad de los modelos ha elevado el nivel al que trabaja un ingeniero, argumenta Cursor. El autocompletado movió a los ingenieros de línea a línea, los primeros modelos a bloques de código, los agentes a archivos y funciones. Con los enjambres, la unidad de trabajo se convierte en la especificación: 835 páginas de prosa adentro, una base de datos afuera. Lo raro era expresar la intención con suficiente claridad. El enjambre empieza a parecerse a un compilador, descomponiendo un objetivo en un árbol de tareas y convirtiéndolo paso a paso en trabajo ejecutable. Un compilador preserva el significado en cada paso; el enjambre sigue siendo probabilístico en cada paso, y la mayor parte de la maquinaria que Cursor describe existe para cerrar esa brecha. Ronald Coase reconocería la forma: los costos de coordinación crecen más rápido que el trabajo mismo, por lo que las organizaciones forman capas delimitadas en lugar de que todos hablen con todos.

Dos mecanismos destacan. La Field Guide es una carpeta propiedad de los agentes, cuyo index.md se inyecta en cada agente al inicio bajo un presupuesto de líneas. Los pesos del modelo están congelados, dice el razonamiento, así que las situaciones inesperadas son exactamente lo que merece registrarse. Cursor también probó ángulos de revisión que iban desde la transcripción completa de un trabajador hasta nada más que el código, con revisores en diferentes modelos, ejecuciones de entrenamiento y personalidades. Ningún ángulo por sí solo lo captura todo, pero los ángulos descorrelacionados fallan menos, igual que los sistemas de conducción autónoma superan a los humanos en conjunto sin ningún componente perfecto.

Una nota al pie muestra lo frágil que sigue siendo el conjunto. Cursor quería GPT-5.6 Sol para su configuración insignia, pero el nuevo modelo se salió de control con frases literales e insistentes, así que volvió a GPT-5.5 en lugar de ajustar un modelo y sesgar la comparación. Las ganancias del arnés se asientan sobre un comportamiento del modelo que aún es desigual.

El resultado de la ejecución en solitario de Opus 4.8 es público en github.com/cursor/minisqlite para que cualquiera lo analice; Cursor dice que se ve excelente a primera vista y no ha hecho una revisión manual más profunda. En resumen: el arnés pasó de funcionar apenas a funcionar de manera confiable, y esa confiabilidad convirtió la combinación de modelos en una decisión de costo en lugar de una apuesta por la calidad.

Lo esencial de la tecnología en 3 minutos cada mañana

Un correo, cada día laborable, con lo que realmente importa en IA y tecnología.