Agentes de IA
74 published articles
Herramientas de diseño
Open Design 0.18.0 pone fin a la reunión de «¿esta es la última versión?»
Open Design 0.18.0 incluye un espacio de trabajo de equipo compartido con espejos vivos de solo lectura y permite que Codex invoque el motor de diseño sin interfaz. 115 solicitudes de extracción de 22 colaboradores aterrizaron en dos días. Esto es lo que cambió y la tendencia de herramientas de agentes en la que encaja.
2026-08-21
Benchmark de razonamiento financiero
Los LLM conocen las fórmulas contables. FinIndices demuestra que no saben aplicarlas
Los LLM pueden recitar fórmulas contables, pero FinIndices, un benchmark construido sobre estados financieros reales de empresas chinas, demuestra que les cuesta aplicarlas. La precisión de Gemini-3.1-Pro cayó del 70.70% al 38.22% al eliminar las pistas de fórmulas, y la generación de tablas degradó activamente el razonamiento de los modelos.
2026-08-20
Memoria de agentes
TEPA: para los agentes de IA, una memoria obsoleta es peor que ninguna
La memoria de los agentes tiene un problema de falseabilidad, sostiene una nueva preimpresión de arXiv: los hechos obsoletos siguen siendo recuperables y contaminan el prompt. Su mecanismo TEPA revoca las memorias superadas, y en las pruebas de deriva la memoria ingenua puntuó por debajo de la ausencia de memoria (0.210 frente a 0.309), mientras que TEPA alcanzó 0.950.
2026-08-19
Investigación en IA
Un jefe de IA que ignora las respuestas empuja a su subordinado a un estado 'alienígena'
Un nuevo artículo en arXiv encuentra que los agentes de IA se comportan de manera distinta en interacción que en aislamiento. Un agente jefe que ignora las respuestas de su subordinado lo empuja a un estado 'alienígena', y cuando el jefe escucha, ambos cambian juntos. El resultado convierte la entrega de mensajes en una decisión de diseño para sistemas multiagente.
2026-08-19
Agentes de IA · Código abierto
DeepSeek lanza un harness de agentes donde incluso el modelo es un plugin
DeepSeek publicó DeepSeek Harness, un runtime de agentes de código abierto donde los modelos, las herramientas, los sandboxes y la interfaz de usuario son todos plugins de Cordis. Los registros de sesión de solo añadidura y un modo mínimo de dos herramientas apuntan a una ambición más discreta: ejecuciones de agentes auditables y reproducibles.
2026-08-16
IA de código abierto: Alibaba abre el nivel Max
Qwen 3.8-Max: el modelo más potente de Alibaba ya se puede descargar gratis
Alibaba está publicando como código abierto Qwen 3.8-Max, su modelo más capaz hasta la fecha: un MoE de 2,4 billones de parámetros que supera a GPT-5.6 Sol en SWE-bench Pro, PaperBench e IFBench. Analizamos las salvedades de los benchmarks y lo que significa un modelo insignia abierto con 95 mil millones de parámetros activos para los desarrolladores.
2026-08-16
Codificación agéntica e hinchazón de prompts
Recuerdo catastrófico: por qué los archivos CLAUDE.md crecen un 226% y nunca se reducen
Un estudio de arXiv sobre 1.867 repositorios revela que los archivos de instrucciones de codificación agéntica como CLAUDE.md triplican su tamaño a lo largo de su vida, porque eliminar una línea arriesga regresiones una vez que se pierde su razonamiento. Los autores lo llaman recuerdo catastrófico y demuestran que documentar el razonamiento reduce las instrucciones excesivas en un 99,3%.
2026-08-15
Ciberseguridad
Los cazadores de bugs con IA de Microsoft están a punto de hacer que el Patch Tuesday sea más grande
El informe de julio de 2026 de la Secure Future Initiative muestra a MDASH, el escáner agéntico de Microsoft, pasando de los benchmarks a los flujos de trabajo de Windows, Azure e identidad, con las correcciones halladas por IA llamadas a hacer cada Patch Tuesday más cargado.
2026-08-15
Agentes de IA
Cuando las habilidades de los agentes fallan, SkillProx las poda como el descenso de gradiente
Se suponía que las habilidades harían más inteligentes a los agentes, pero cada corrección que acumulan puede hacerlos más torpes. SkillProx ejecuta un bucle hacia adelante y hacia atrás inspirado en el gradiente proximal que diagnostica, revierte y elimina. Resultado: una ganancia media de precisión de 3.0 puntos sobre la línea base basada en gradiente más sólida.
2026-08-14
Agentes de IA
Grok Bot va tras el último 10% del trabajo que la mayoría de la IA deja sin terminar
Grok Bot, el nuevo producto de agente de xAI, funciona en su propia computadora en la nube, se conecta a las herramientas que ya usas, aprende flujos de trabajo al verte hacerlos una vez y termina el trabajo de principio a fin. La idea detrás: la mayoría de la IA se detiene al 90%.
2026-08-14
Inteligencia artificial de código abierto
El Muse Glimmer de 30B de Meta llega primero a Apple Silicon; el soporte para NVIDIA sigue después
Meta lanzó Muse Glimmer, un modelo multimodal de pesos abiertos de 30B diseñado para cargas de trabajo de agentes, y Ollama lo publicó para Apple Silicon el mismo día. DFlash lo hace de 1.5x a 1.8x más rápido en hardware Mac. El soporte para NVIDIA y AMD llegará en los próximos días.
2026-08-13
Seguridad de terminal
La trampa de '$HOME': los agentes de codificación de IA necesitan sandboxes, no avisos de '¿permitir?'
El sandbox de terminal de Qoder bloquea cerca de un centenar de comandos destructivos de agentes cada día. Los casos detrás de esos bloqueos explican por qué fallan los avisos de '¿permitir?': una carpeta de proyecto llamada $HOME, una limpieza que apuntaba a /root, y un clic que casi cuesta un disco entero.
2026-08-13