SevenTnewS

codificación agéntica

9 published articles

Laboratorios e Investigación5 min read

IA / Investigación en codificación agéntica

Blast Radius entierra el contexto muerto. Cero de 450 cuerpos volvieron

Un nuevo artículo de arXiv, Blast Radius, trata el contexto de agente desperdiciado como materia muerta y lo entierra de forma reversible: ahorro de tokens del 17-26% en siete modelos de OpenAI, 450 contextos archivados, cero recuperaciones. El objetivo más audaz del artículo es hacer sostenible la codificación agéntica, un token recuperado a la vez.

2026-08-19

Agentes de IA4 min read

Codificación agéntica e hinchazón de prompts

Recuerdo catastrófico: por qué los archivos CLAUDE.md crecen un 226% y nunca se reducen

Un estudio de arXiv sobre 1.867 repositorios revela que los archivos de instrucciones de codificación agéntica como CLAUDE.md triplican su tamaño a lo largo de su vida, porque eliminar una línea arriesga regresiones una vez que se pierde su razonamiento. Los autores lo llaman recuerdo catastrófico y demuestran que documentar el razonamiento reduce las instrucciones excesivas en un 99,3%.

2026-08-15

xAI / GrokFeatured4 min read

Inteligencia Artificial

Grok 4.6 empata con GPT-5.6 Sol en 61, pero las puntuaciones por componente se dividen

El Grok 4.6 de xAI empata con GPT-5.6 Sol en 61 en el Artificial Analysis Intelligence Index, un compuesto de nueve benchmarks. El desglose es desigual: victorias en trabajo de conocimiento y en la mayoría de las pruebas de código, pérdidas en DeepSWE y Terminal-Bench. Disponible ahora en Cursor y Grok Build, desde $2 por millón de tokens de entrada.

2026-08-13

IDEs de IA5 min read

IDEs de IA

Cursor ataca los costos de los agentes con un plan en India a ₹649 y un enrutador de modelos

La actualización de julio de Cursor añade un plan para India a ₹649 al mes y un modo Auto que enruta las solicitudes a modelos más baratos, junto con revisión completa de PR en iPhone y iPad y agentes que trabajan en Slack. El lanzamiento trata realmente de controlar los costos de la codificación con agentes.

2026-08-05

Qwen / AlibabaFeatured5 min read

IA de código abierto

Qwen3.8-Max superó a 458 equipos humanos en 24 horas, trabajando solo

Qwen3.8-Max superó a 458 de 526 equipos humanos en un concurso de 24 horas mientras trabajaba solo, y Alibaba publicará sus pesos como código abierto la próxima semana. Por ahora, todas las cifras son autodeclaradas, lo cual es exactamente por lo que las afirmaciones de autonomía merecen ser examinadas.

2026-08-03

Pruebas y BenchmarksFeatured2 min read

Análisis de benchmarks

En SWE-bench Verified, los mejores modelos alcanzan el 96%. En código privado de empresas, apenas superan el 23%

SWE-bench Verified hace que los modelos fronterizos parezcan estar cerca de resolver la ingeniería de software del mundo real, con puntuaciones superiores al 95%. SWE-bench Pro, ejecutado en repositorios privados de empresas, reduce esos mismos modelos al 23% o menos, exponiendo cuánto dependía la puntuación de Verified de la exposición a datos públicos.

2026-08-02

IDEs de IA2 min read

Lanzamiento de producto

El plan de Cursor para India a 649 INR al mes incluye un enrutador de modelos que elige el modelo más barato para cada tarea

Cursor Start ofrece a los desarrolladores indios un precio local con UPI, mientras que Cursor Router permite a los equipos controlar el equilibrio entre costo e inteligencia por solicitud. Dos funciones que reducen la barrera y optimizan el gasto.

2026-08-01

IA5 min read

Alibaba Qoder

El código de IA tiene el doble de probabilidades de tener errores. Qoder lo soluciona durante la sesión

Qoder Security integra un ingeniero de seguridad dedicado en cada sesión de codificación con IA, detectando vulnerabilidades en el momento en que se escribe el código, no días después en el despliegue.

2026-07-30

CiberseguridadFeatured4 min read

Seguridad en la codificación con IA

El punto ciego en el código generado por IA que Alibaba corrige a mitad de la frase

Alibaba Cloud lanza Qoder Security, un sistema de revisión de código en sesión diseñado para detectar vulnerabilidades durante el desarrollo en lugar de en la etapa de CI. La plataforma afirma un 80% menos de falsos positivos y ciclos de corrección de horas.

2026-07-26