Agentes LLM
13 published articles
Fisher-R1 | Prueba de hipótesis
Los agentes de IA ejecutan estadísticas impecables y aun así llegan a conclusiones equivocadas
Los agentes que automatizan la prueba de hipótesis pueden ejecutar análisis a la perfección y aun así llegar a conclusiones erróneas, porque la mayoría de los benchmarks nunca comprueban si el valor p es válido. Un benchmark de 425 tareas cuantifica la brecha, y un modelo de peso abierto entrenado con RL cierra una parte de ella.
2026-08-19
Agentes de IA
PsychoAgent dotó a los agentes de IA de memoria emocional. Los evaluadores no encontraron ventaja
PsychoAgent ofrece a los agentes LLM una memoria afectiva separada para que los rastros emocionalmente salientes y cargados de conflicto puedan pesar más que los meramente temáticos. En tres escenarios de conflicto recuperó más memorias críticas para el conflicto que ambas líneas base (0.933 frente a 0.500 y 0.667), aunque cinco evaluadores ciegos no encontraron una ventaja significativa de calidad.
2026-08-19
Investigación en IA
Basta de copiar y pegar habilidades: la solución sin evaluación de SkillZip para agentes inflados
Los agentes autoevolutivos añaden correcciones hasta que la misma regla aparece en varias ramas. SkillZip comprime sus habilidades sin rollouts de evaluación, al encontrar la explicación estructural fiel más corta. Modos One-shot y Zip-on-Write, y lo que el resumen deja sin demostrar.
2026-08-15
Agentes de IA
Tratar los SOP como código: un nuevo runtime con paginación de pila separa a los agentes fuertes de los débiles
Una nueva investigación de Hong Kong y China continental demuestra que compilar SOP en pseudocódigo ejecutable y ejecutarlos en una máquina virtual con pila paginada separa limpiamente a los agentes capaces de los frágiles. El trabajo produce una regla de implementación precisa: compilar primero, paginar solo después de una verificación de disciplina a nivel de modelo.
2026-08-04
Agentes LLM
El impuesto de regresión: por qué cargar a los agentes LLM con habilidades puede resultar contraproducente
Un nuevo estudio muestra que agregar habilidades procedimentales a los agentes LLM no siempre ayuda, puede introducir regresiones, donde tareas previamente resueltas sin habilidades fallan después de agregarlas. La investigación identifica tres causas y argumenta que la fiabilidad depende más del anclaje y la verificación que de la habilidad en sí misma.
2026-08-03
Inteligencia Artificial
La generación de ideas de investigación mejora 3,89 veces con IDEAgent
IDEAgent utiliza linajes, retroalimentación multiobjetivo y memoria secuencial para equilibrar calidad y diversidad en ideas de investigación generadas por LLM. Probado en 32 temas en 8 dominios de CS, logra 3,89 veces el Rendimiento (ideas diversas por encima de un umbral de calidad) de métodos anteriores.
2026-08-02
IA industrial
AgentRCA: análisis de causa raíz zero-shot que explica su propio razonamiento
Un framework agéntico zero-shot llamado AgentRCA utiliza un gemelo digital y un LLM para diagnosticar fallos en plantas sin datos etiquetados, logrando una precisión a nivel supervisado con total transparencia.
2026-08-01
Investigación
Seis palabras que podrían remodelar cómo los agentes de IA exploran y se mantienen seguros: disruptir, validar, intermediar
Una novedosa arquitectura de cohorte de agentes heterogéneos separa la exploración divergente, el control de seguridad en tiempo de ejecución y la recuperación de conocimiento entre dominios en roles especializados. El Disruptor genera propuestas de alta entropía, el Validador impone comprobaciones estrictas de llamadas a herramientas, y el Intermediario importa analogías fuera de dominio mediante recuperación de novedad contrastiva. Los fallos de ejecución se compilan en parches de restricción firmados llamados Scars, almacenados en caché para generaciones futuras. En las evaluaciones, la cohorte logró un 95% de descubrimiento de objetivos remotos, cero infracciones ejecutadas y un 15.1% de ahorro de tokens gracias a Scars, con una reducción del 55.9% en costos bajo restricciones de recursos mediante asignación de ancho de banda basada en créditos.
2026-07-30
Investigación en IA
La evolución de harness se ve impresionante hasta que la pruebas en tareas no vistas
Se espera que la evolución automática de harness haga mejores a los agentes LLM, pero un nuevo artículo argumenta que muchas de las mejoras reportadas pueden deberse a sobreajuste al conjunto de prueba público. En experimentos, métodos simples de escalado en tiempo de prueba igualaron o superaron a la evolución, y los harness evolucionados mostraron una generalización limitada a tareas no vistas.
2026-07-27
Investigación
La brecha de supervisión en RL agéntico acaba de recibir una solución gracias a la retrospectiva
SEED (Destilación Autoevolutiva en Política) permite que un LLM analice sus propias trayectorias pasadas, extraiga habilidades retrospectivas reutilizables en lenguaje natural y luego destile esas lecciones de vuelta a su política durante el RL. El resultado: una supervisión más densa y en política que mejora la eficiencia de muestreo y se generaliza a tareas no vistas.
2026-07-25
Razonamiento de largo alcance
Un nuevo marco ayuda a los agentes de IA a recordar lo que hicieron hace cinco minutos
PRO-LONG es un marco mínimo que ayuda a los agentes LLM a retener y recuperar información a lo largo de secuencias largas de acciones. En el benchmark ARC-AGI-3, mejoró las tasas de aprobación promedio en 18 puntos porcentuales entre los modelos fronterizos, utilizando entre 4.2 y 5.8 veces menos tokens que los arneses existentes. Con Fable 5, alcanzó un 97.4% best@2 con un costo total de inferencia de $1,750.
2026-07-24
Investigación en IA
El ruidoso truco que evita que los agentes LLM colapsen en producción
Los agentes LLM actuales se desmoronan ante la aleatoriedad del mundo real. NoisyAgent los expone a ruido controlado durante el entrenamiento, mejorando tanto la robustez como el rendimiento general en benchmarks. El artículo sugiere que el campo ha estado sobreajustándose a condiciones prístinas.
2026-07-17