SevenTnewS

Codificación agéntica e hinchazón de prompts

Recuerdo catastrófico: por qué los archivos CLAUDE.md crecen un 226% y nunca se reducen

Un estudio de arXiv sobre 1.867 repositorios revela que los archivos de instrucciones de codificación agéntica como CLAUDE.md triplican su tamaño a lo largo de su vida, porque eliminar una línea arriesga regresiones una vez que se pierde su razonamiento. Los autores lo llaman recuerdo catastrófico y demuestran que documentar el razonamiento reduce las instrucciones excesivas en un 99,3%.

Emmanuel Fabrice Omgbwa Yasse Asistido por IA

2026-08-15 · 4 min de lectura

Recuerdo catastrófico: por qué los archivos CLAUDE.md crecen un 226% y nunca se reducen

Todo desarrollador que haya trabajado con un agente de codificación conoce esa sensación. El archivo de instrucciones del proyecto, CLAUDE.md en configuraciones de Claude Code o uno de sus equivalentes, comienza como una lista ordenada de reglas. Meses después se lee como una acumulación de decisiones que nadie puede explicar del todo, y nadie se atreve a podarlo, porque eliminar la línea equivocada podría romper silenciosamente el comportamiento del agente.

Eso no es un problema de hábitos humanos. Es estructural, y un artículo publicado en arXiv el 11 de agosto de 2026 le da nombre. Escrito por Kushal Chakrabarti, "Why Does CLAUDE.md Keep Growing?" llama al patrón recuerdo catastrófico: la imagen especular del olvido catastrófico que la investigación en aprendizaje continuo ha rondado durante años.

Las cifras detrás de la hinchazón

El artículo rastrea 247.694 vidas de instrucciones en 1.867 repositorios. El patrón se cumple en todas partes: los prompts agénticos crecen sin límite, más que triplican su tamaño a lo largo de su vida, un aumento del 226%. Cada commit añade 4,9 instrucciones netas. Y cuanto más antigua es una instrucción, menos probable es que desaparezca: el riesgo de eliminación cae 0,032 por commit en una escala logarítmica. El archivo solo deja de crecer cuando el repositorio se retira o alguien lo reescribe desde cero.

MétricaValor
Repositorios estudiados1.867
Vidas de instrucciones rastreadas247.694
Crecimiento del prompt a lo largo de su vida+226%
Instrucciones netas añadidas por commit+4,9
Riesgo de eliminación por commit-0,032 (escala logarítmica)
Instrucciones excesivas eliminadas con comentarios99,3%
Mejora real en el seguimiento de instrucciones+23,1%

La mecánica explica los datos. Añadir una instrucción no cuesta nada: una línea más, listo. Eliminar una es otro juego. Una vez que se pierde el razonamiento detrás de una instrucción, eliminarla sin arriesgar una regresión de corrección cuesta O(2^|D|) en un prompt de |D| instrucciones. Nadie paga esa factura. El archivo solo crece.

Por qué eliminar es la jugada cara

La razón por la que esa factura es tan difícil de tasar va más allá del prompt. Un trabajo relacionado del equipo de investigación de Qwen, "The Verification Horizon", sostiene que el cuello de botella de los agentes de codificación actuales ha cambiado de lado: generar soluciones candidatas ya no es la parte difícil; verificarlas de forma fiable sí lo es. Cada verificador que un equipo puede construir es solo un proxy de la intención humana, nunca la intención misma. Si no puedes demostrar de forma barata que eliminar una instrucción no cambia nada, mantenerla parece racional incluso cuando es peso muerto.

Ahí es donde aterriza la solución del artículo. Los autores invierten IFEval, un benchmark estándar de seguimiento de instrucciones, para construir "mundos verificables" donde el prompt óptimo se conoce de antemano. En esos entornos controlados, los comentarios que codifican el razonamiento latente detrás de las instrucciones eliminan el 99,3% de las instrucciones excesivas, reduciendo el crecimiento del +211,3% al +1,4%. Aplicando la misma inversión a WildIFEval, un benchmark del mundo real más ruidoso, los comentarios en los prompts mejoran el seguimiento de instrucciones hasta en un 23,1%.

Comentarios, pero para prompts

El artículo termina con una pregunta que merece viajar: "Si el inglés es el nuevo código, ¿por qué aún no tenemos comentarios?"

El punto no es la documentación para humanos. Los comentarios que registran por qué existe una instrucción dan al siguiente editor, humano o modelo, la información necesaria para eliminarla con seguridad. El razonamiento es lo que vuelve a abaratar la eliminación, porque el problema del costo solo aparece una vez que ese razonamiento se pierde. Un prompt con razones adjuntas es un prompt que puede reducirse. Sin ellas, cada instrucción se convierte en un compromiso permanente que nadie puede auditar. La lectura práctica es casi aburrida: trata el archivo de instrucciones como código, revisa las adiciones como revisarías cualquier commit, y exige que cada regla lleve su porqué.

El artículo es un preprint, y sus experimentos controlados no demuestran que los comentarios vayan a domar todos los CLAUDE.md de producción. Pero el hallazgo subyacente es difícil de discutir: un archivo que solo acumula, donde nada puede eliminarse con seguridad, es un archivo en un camino de un solo sentido hacia la hinchazón. Nombrar el fallo es el primer paso, y el nombre perdurará, porque cualquiera que haya visto triplicarse un archivo de instrucciones sabe exactamente cómo se siente el recuerdo catastrófico.

Lo esencial de la tecnología en 3 minutos cada mañana

Un correo, cada día laborable, con lo que realmente importa en IA y tecnología.