Agentes LLM
15 published articles
Razonamiento de largo alcance
Un nuevo marco ayuda a los agentes de IA a recordar lo que hicieron hace cinco minutos
PRO-LONG es un marco mínimo que ayuda a los agentes LLM a retener y recuperar información a lo largo de secuencias largas de acciones. En el benchmark ARC-AGI-3, mejoró las tasas de aprobación promedio en 18 puntos porcentuales entre los modelos fronterizos, utilizando entre 4.2 y 5.8 veces menos tokens que los arneses existentes. Con Fable 5, alcanzó un 97.4% best@2 con un costo total de inferencia de $1,750.
2026-07-24
Investigación en IA
El ruidoso truco que evita que los agentes LLM colapsen en producción
Los agentes LLM actuales se desmoronan ante la aleatoriedad del mundo real. NoisyAgent los expone a ruido controlado durante el entrenamiento, mejorando tanto la robustez como el rendimiento general en benchmarks. El artículo sugiere que el campo ha estado sobreajustándose a condiciones prístinas.
2026-07-17
Investigación en IA
Tu agente de IA aprobó la prueba por accidente. Ahora hay una rúbrica para eso.
SkillCoach es un marco de rúbricas autoevolutivas que evalúa y mejora el uso de habilidades agentivas analizando los procesos de selección, seguimiento, composición y reflexión de habilidades, proporcionando una mejor supervisión que las métricas basadas solo en resultados.
2026-07-06