SevenTnewS

Agentes LLM

13 published articles

Laboratorios e Investigación3 min read

Fisher-R1 | Prueba de hipótesis

Los agentes de IA ejecutan estadísticas impecables y aun así llegan a conclusiones equivocadas

Los agentes que automatizan la prueba de hipótesis pueden ejecutar análisis a la perfección y aun así llegar a conclusiones erróneas, porque la mayoría de los benchmarks nunca comprueban si el valor p es válido. Un benchmark de 425 tareas cuantifica la brecha, y un modelo de peso abierto entrenado con RL cierra una parte de ella.

2026-08-19

Agentes de IA4 min read

Agentes de IA

PsychoAgent dotó a los agentes de IA de memoria emocional. Los evaluadores no encontraron ventaja

PsychoAgent ofrece a los agentes LLM una memoria afectiva separada para que los rastros emocionalmente salientes y cargados de conflicto puedan pesar más que los meramente temáticos. En tres escenarios de conflicto recuperó más memorias críticas para el conflicto que ambas líneas base (0.933 frente a 0.500 y 0.667), aunque cinco evaluadores ciegos no encontraron una ventaja significativa de calidad.

2026-08-19

Agentes de IA4 min read

Investigación en IA

Basta de copiar y pegar habilidades: la solución sin evaluación de SkillZip para agentes inflados

Los agentes autoevolutivos añaden correcciones hasta que la misma regla aparece en varias ramas. SkillZip comprime sus habilidades sin rollouts de evaluación, al encontrar la explicación estructural fiel más corta. Modos One-shot y Zip-on-Write, y lo que el resumen deja sin demostrar.

2026-08-15

IA5 min read

Agentes de IA

Tratar los SOP como código: un nuevo runtime con paginación de pila separa a los agentes fuertes de los débiles

Una nueva investigación de Hong Kong y China continental demuestra que compilar SOP en pseudocódigo ejecutable y ejecutarlos en una máquina virtual con pila paginada separa limpiamente a los agentes capaces de los frágiles. El trabajo produce una regla de implementación precisa: compilar primero, paginar solo después de una verificación de disciplina a nivel de modelo.

2026-08-04

Agentes de IA4 min read

Agentes LLM

El impuesto de regresión: por qué cargar a los agentes LLM con habilidades puede resultar contraproducente

Un nuevo estudio muestra que agregar habilidades procedimentales a los agentes LLM no siempre ayuda, puede introducir regresiones, donde tareas previamente resueltas sin habilidades fallan después de agregarlas. La investigación identifica tres causas y argumenta que la fiabilidad depende más del anclaje y la verificación que de la habilidad en sí misma.

2026-08-03

LLMs y Modelos3 min read

Inteligencia Artificial

La generación de ideas de investigación mejora 3,89 veces con IDEAgent

IDEAgent utiliza linajes, retroalimentación multiobjetivo y memoria secuencial para equilibrar calidad y diversidad en ideas de investigación generadas por LLM. Probado en 32 temas en 8 dominios de CS, logra 3,89 veces el Rendimiento (ideas diversas por encima de un umbral de calidad) de métodos anteriores.

2026-08-02

Agentes de IA3 min read

IA industrial

AgentRCA: análisis de causa raíz zero-shot que explica su propio razonamiento

Un framework agéntico zero-shot llamado AgentRCA utiliza un gemelo digital y un LLM para diagnosticar fallos en plantas sin datos etiquetados, logrando una precisión a nivel supervisado con total transparencia.

2026-08-01

IA5 min read

Investigación

Seis palabras que podrían remodelar cómo los agentes de IA exploran y se mantienen seguros: disruptir, validar, intermediar

Una novedosa arquitectura de cohorte de agentes heterogéneos separa la exploración divergente, el control de seguridad en tiempo de ejecución y la recuperación de conocimiento entre dominios en roles especializados. El Disruptor genera propuestas de alta entropía, el Validador impone comprobaciones estrictas de llamadas a herramientas, y el Intermediario importa analogías fuera de dominio mediante recuperación de novedad contrastiva. Los fallos de ejecución se compilan en parches de restricción firmados llamados Scars, almacenados en caché para generaciones futuras. En las evaluaciones, la cohorte logró un 95% de descubrimiento de objetivos remotos, cero infracciones ejecutadas y un 15.1% de ahorro de tokens gracias a Scars, con una reducción del 55.9% en costos bajo restricciones de recursos mediante asignación de ancho de banda basada en créditos.

2026-07-30

Herramientas y Frameworks3 min read

Investigación en IA

La evolución de harness se ve impresionante hasta que la pruebas en tareas no vistas

Se espera que la evolución automática de harness haga mejores a los agentes LLM, pero un nuevo artículo argumenta que muchas de las mejoras reportadas pueden deberse a sobreajuste al conjunto de prueba público. En experimentos, métodos simples de escalado en tiempo de prueba igualaron o superaron a la evolución, y los harness evolucionados mostraron una generalización limitada a tareas no vistas.

2026-07-27

LLMs y ModelosFeatured4 min read

Investigación

La brecha de supervisión en RL agéntico acaba de recibir una solución gracias a la retrospectiva

SEED (Destilación Autoevolutiva en Política) permite que un LLM analice sus propias trayectorias pasadas, extraiga habilidades retrospectivas reutilizables en lenguaje natural y luego destile esas lecciones de vuelta a su política durante el RL. El resultado: una supervisión más densa y en política que mejora la eficiencia de muestreo y se generaliza a tareas no vistas.

2026-07-25

IA4 min read

Razonamiento de largo alcance

Un nuevo marco ayuda a los agentes de IA a recordar lo que hicieron hace cinco minutos

PRO-LONG es un marco mínimo que ayuda a los agentes LLM a retener y recuperar información a lo largo de secuencias largas de acciones. En el benchmark ARC-AGI-3, mejoró las tasas de aprobación promedio en 18 puntos porcentuales entre los modelos fronterizos, utilizando entre 4.2 y 5.8 veces menos tokens que los arneses existentes. Con Fable 5, alcanzó un 97.4% best@2 con un costo total de inferencia de $1,750.

2026-07-24

IAFeatured3 min read

Investigación en IA

El ruidoso truco que evita que los agentes LLM colapsen en producción

Los agentes LLM actuales se desmoronan ante la aleatoriedad del mundo real. NoisyAgent los expone a ruido controlado durante el entrenamiento, mejorando tanto la robustez como el rendimiento general en benchmarks. El artículo sugiere que el campo ha estado sobreajustándose a condiciones prístinas.

2026-07-17

← PreviousPage 1 / 2 · 13 articlesNext →