SevenTnewS

arXiv

18 published articles

Agentes de IA4 min read

Memoria de agentes

TEPA: para los agentes de IA, una memoria obsoleta es peor que ninguna

La memoria de los agentes tiene un problema de falseabilidad, sostiene una nueva preimpresión de arXiv: los hechos obsoletos siguen siendo recuperables y contaminan el prompt. Su mecanismo TEPA revoca las memorias superadas, y en las pruebas de deriva la memoria ingenua puntuó por debajo de la ausencia de memoria (0.210 frente a 0.309), mientras que TEPA alcanzó 0.950.

2026-08-19

IA5 min read

Escalado en tiempo de prueba

El enrutamiento de CoBa iguala la votación best-of-16 con un 58,9 % menos de tokens

CoBa, una política de enrutamiento equilibrado de cómputo de un nuevo artículo de arXiv, iguala la votación mayoritaria best-of-16 dentro de 0,01 puntos mientras reduce los tokens ponderados por parámetro en un 58,9 %. En 3.129 evaluaciones en MATH-500, AIME y AMC, también supera rotundamente a la decodificación de muestra única, aunque persiste una pequeña ventaja de best-of-16 cuando el presupuesto no es una limitación.

2026-08-19

Laboratorios e Investigación5 min read

IA / Investigación en codificación agéntica

Blast Radius entierra el contexto muerto. Cero de 450 cuerpos volvieron

Un nuevo artículo de arXiv, Blast Radius, trata el contexto de agente desperdiciado como materia muerta y lo entierra de forma reversible: ahorro de tokens del 17-26% en siete modelos de OpenAI, 450 contextos archivados, cero recuperaciones. El objetivo más audaz del artículo es hacer sostenible la codificación agéntica, un token recuperado a la vez.

2026-08-19

Agentes de IA4 min read

Agentes de IA

PsychoAgent dotó a los agentes de IA de memoria emocional. Los evaluadores no encontraron ventaja

PsychoAgent ofrece a los agentes LLM una memoria afectiva separada para que los rastros emocionalmente salientes y cargados de conflicto puedan pesar más que los meramente temáticos. En tres escenarios de conflicto recuperó más memorias críticas para el conflicto que ambas líneas base (0.933 frente a 0.500 y 0.667), aunque cinco evaluadores ciegos no encontraron una ventaja significativa de calidad.

2026-08-19

Laboratorios e Investigación4 min read

Investigación en IA

Un jefe de IA que ignora las respuestas empuja a su subordinado a un estado 'alienígena'

Un nuevo artículo en arXiv encuentra que los agentes de IA se comportan de manera distinta en interacción que en aislamiento. Un agente jefe que ignora las respuestas de su subordinado lo empuja a un estado 'alienígena', y cuando el jefe escucha, ambos cambian juntos. El resultado convierte la entrega de mensajes en una decisión de diseño para sistemas multiagente.

2026-08-19

Laboratorios e Investigación4 min read

Investigación en IA

Las cadenas de pensamiento más largas chocan contra un muro. ThinkRetrieve inyecta la solución a mitad del razonamiento

El escalado secuencial en tiempo de prueba suele toparse con rendimientos decrecientes o incluso negativos, sostiene un nuevo preprint. ThinkRetrieve recupera ejemplos resueltos a mitad del razonamiento y los inyecta en la traza, con ganancias relativas de hasta el 60% en AIME 2025 en cinco modelos pequeños de razonamiento.

2026-08-18

PLN y ML3 min read

Grafos de conocimiento e IA urbana

Las estaciones no son islas: cómo RTSKG reorganiza los datos del transporte urbano

Los modelos de transporte a escala urbana suelen ignorar cómo se relacionan las estaciones con las carreteras y los negocios. RTSKG, un conjunto de datos de grafo de conocimiento publicado en arXiv, modela esas interacciones explícitamente y reporta mejoras en la recomendación de tiendas y la predicción de afluencia de pasajeros.

2026-08-18

Agentes de IA4 min read

Investigación en IA

Basta de copiar y pegar habilidades: la solución sin evaluación de SkillZip para agentes inflados

Los agentes autoevolutivos añaden correcciones hasta que la misma regla aparece en varias ramas. SkillZip comprime sus habilidades sin rollouts de evaluación, al encontrar la explicación estructural fiel más corta. Modos One-shot y Zip-on-Write, y lo que el resumen deja sin demostrar.

2026-08-15

Agentes de IA4 min read

Agentes de IA

Cuando las habilidades de los agentes fallan, SkillProx las poda como el descenso de gradiente

Se suponía que las habilidades harían más inteligentes a los agentes, pero cada corrección que acumulan puede hacerlos más torpes. SkillProx ejecuta un bucle hacia adelante y hacia atrás inspirado en el gradiente proximal que diagnostica, revierte y elimina. Resultado: una ganancia media de precisión de 3.0 puntos sobre la línea base basada en gradiente más sólida.

2026-08-14

IA4 min read

Comprensión de video

Gemini 3.6 Flash cuenta cambios de estado pero no detecta parpadeos

Los modelos de lenguaje de video fallan en el registro simple de eventos, según muestra un nuevo estudio de arXiv. Gemini 3.6 Flash cuenta cambios de estado persistentes hasta 12 eventos, pero no tiene una región confiable para los parpadeos transitorios; los fotogramas adicionales inflan la precisión sin una recuperación fiel, con solo el 0.2% de los conteos finales correctos en el régimen de conteo alto.

2026-08-12

LLMs y ModelosFeatured4 min read

Seguridad de IA

Shieldstral, el clasificador de 3B que supera a modelos siete veces más grandes

Un clasificador de seguridad de 3B iguala a los modelos de texto casi siete veces más grandes y establece un nuevo estado del arte en moderación multimodal, según un artículo de arXiv de julio de 2026. El truco: la moderación reformulada como respuesta a preguntas binarias, entrenada con aproximadamente 54,1 millones de muestras.

2026-08-05

LLMs y Modelos4 min read

Destilación de LLM

La destilación de LLM se estanca cuando el contexto se vuelve estático. Este artículo lo hace evolucionar

Los contextos pueden llevar las preferencias de la tarea al entrenamiento de LLM, pero una vez destilados en un estudiante añaden poca supervisión. Flux-OPD de la Universidad de Pekín mantiene el contexto en movimiento con el estudiante y utiliza un término de conflicto para ponderar las correcciones del profesor. El resumen reporta mejoras sobre los paradigmas OPD existentes sin citar cifras.

2026-07-31

← PreviousPage 1 / 2 · 18 articlesNext →