codificación agéntica
9 published articles
IA / Investigación en codificación agéntica
Blast Radius entierra el contexto muerto. Cero de 450 cuerpos volvieron
Un nuevo artículo de arXiv, Blast Radius, trata el contexto de agente desperdiciado como materia muerta y lo entierra de forma reversible: ahorro de tokens del 17-26% en siete modelos de OpenAI, 450 contextos archivados, cero recuperaciones. El objetivo más audaz del artículo es hacer sostenible la codificación agéntica, un token recuperado a la vez.
2026-08-19
Codificación agéntica e hinchazón de prompts
Recuerdo catastrófico: por qué los archivos CLAUDE.md crecen un 226% y nunca se reducen
Un estudio de arXiv sobre 1.867 repositorios revela que los archivos de instrucciones de codificación agéntica como CLAUDE.md triplican su tamaño a lo largo de su vida, porque eliminar una línea arriesga regresiones una vez que se pierde su razonamiento. Los autores lo llaman recuerdo catastrófico y demuestran que documentar el razonamiento reduce las instrucciones excesivas en un 99,3%.
2026-08-15
Inteligencia Artificial
Grok 4.6 empata con GPT-5.6 Sol en 61, pero las puntuaciones por componente se dividen
El Grok 4.6 de xAI empata con GPT-5.6 Sol en 61 en el Artificial Analysis Intelligence Index, un compuesto de nueve benchmarks. El desglose es desigual: victorias en trabajo de conocimiento y en la mayoría de las pruebas de código, pérdidas en DeepSWE y Terminal-Bench. Disponible ahora en Cursor y Grok Build, desde $2 por millón de tokens de entrada.
2026-08-13
IDEs de IA
Cursor ataca los costos de los agentes con un plan en India a ₹649 y un enrutador de modelos
La actualización de julio de Cursor añade un plan para India a ₹649 al mes y un modo Auto que enruta las solicitudes a modelos más baratos, junto con revisión completa de PR en iPhone y iPad y agentes que trabajan en Slack. El lanzamiento trata realmente de controlar los costos de la codificación con agentes.
2026-08-05
IA de código abierto
Qwen3.8-Max superó a 458 equipos humanos en 24 horas, trabajando solo
Qwen3.8-Max superó a 458 de 526 equipos humanos en un concurso de 24 horas mientras trabajaba solo, y Alibaba publicará sus pesos como código abierto la próxima semana. Por ahora, todas las cifras son autodeclaradas, lo cual es exactamente por lo que las afirmaciones de autonomía merecen ser examinadas.
2026-08-03
Análisis de benchmarks
En SWE-bench Verified, los mejores modelos alcanzan el 96%. En código privado de empresas, apenas superan el 23%
SWE-bench Verified hace que los modelos fronterizos parezcan estar cerca de resolver la ingeniería de software del mundo real, con puntuaciones superiores al 95%. SWE-bench Pro, ejecutado en repositorios privados de empresas, reduce esos mismos modelos al 23% o menos, exponiendo cuánto dependía la puntuación de Verified de la exposición a datos públicos.
2026-08-02
Lanzamiento de producto
El plan de Cursor para India a 649 INR al mes incluye un enrutador de modelos que elige el modelo más barato para cada tarea
Cursor Start ofrece a los desarrolladores indios un precio local con UPI, mientras que Cursor Router permite a los equipos controlar el equilibrio entre costo e inteligencia por solicitud. Dos funciones que reducen la barrera y optimizan el gasto.
2026-08-01
Alibaba Qoder
El código de IA tiene el doble de probabilidades de tener errores. Qoder lo soluciona durante la sesión
Qoder Security integra un ingeniero de seguridad dedicado en cada sesión de codificación con IA, detectando vulnerabilidades en el momento en que se escribe el código, no días después en el despliegue.
2026-07-30
Seguridad en la codificación con IA
El punto ciego en el código generado por IA que Alibaba corrige a mitad de la frase
Alibaba Cloud lanza Qoder Security, un sistema de revisión de código en sesión diseñado para detectar vulnerabilidades durante el desarrollo en lugar de en la etapa de CI. La plataforma afirma un 80% menos de falsos positivos y ciclos de corrección de horas.
2026-07-26