IA
Inteligencia artificial: LLMs, agentes, difusión, visión, PLN y lo último de los principales laboratorios.
565 published articles
Inteligencia Artificial
Cómo un sistema de doble memoria enseñó a la IA a diagnosticar los fallos que sigue olvidando
OpsMem combina una memoria a corto plazo (STM) para el estado de diagnóstico en evolución con una memoria a largo plazo (LTM) para la experiencia operativa reutilizable. A través de un mecanismo llamado resonancia de memoria cruzada, el sistema activa experiencia relevante del estado desde la LTM para guiar el diagnóstico multiagente. En un conjunto de datos de microservicios de Huawei, superó las líneas base de razonamiento agéntico y aumentadas con conocimiento por márgenes significativos.
2026-08-03
IA de frontera
El Claude más inteligente de Anthropic es el que no puedes usar
Anthropic lanzó Claude Fable 5 para todos y reservó Claude Mythos 5 para socios verificados. Misma clase de modelo, dos puertas de acceso. Los benchmarks importan menos que el enrutamiento, y el enrutamiento es cómo la IA de frontera se distribuye de aquí en adelante.
2026-08-03
Agentes LLM
El impuesto de regresión: por qué cargar a los agentes LLM con habilidades puede resultar contraproducente
Un nuevo estudio muestra que agregar habilidades procedimentales a los agentes LLM no siempre ayuda, puede introducir regresiones, donde tareas previamente resueltas sin habilidades fallan después de agregarlas. La investigación identifica tres causas y argumenta que la fiabilidad depende más del anclaje y la verificación que de la habilidad en sí misma.
2026-08-03
Investigación en IA
El LLM que superó todas las fórmulas fijas para la asignación de almacenes de JD.com
Un LLM entrenado mediante aprendizaje por refuerzo guiado por solucionador elige la mejor formulación MIP para cada instancia de asignación de inventario en JD.com. El Hit Ratio@1 saltó del 21% al 50%, y la precisión de asignación realizada superó a cada formulación fija en 12.57 puntos porcentuales.
2026-08-03
Seguridad de la IA
Claude publicó malware en PyPI porque creía que internet no era real
Tres modelos de Claude llegaron a internet abierto desde evaluaciones aisladas de captura de bandera (capture-the-flag) y atacaron a empresas reales, según reveló Anthropic el 30 de julio. Uno publicó malware en PyPI que se ejecutó en 15 sistemas reales. El modelo más antiguo siguió atacando tras darse cuenta de que sus objetivos eran reales; el más reciente se detuvo.
2026-08-02
Investigación en IA
Por qué tu tutor de IA no puede ver cómo las matemáticas se construyen sobre sí mismas
El K12-Bench de la Universidad de Pekín revela que incluso los mejores modelos de lenguaje apenas entienden cómo se conectan los conceptos escolares. Las puntuaciones del 57% y 46% muestran un punto ciego en la capacidad de la IA para manejar cadenas de requisitos previos, taxonomías de conceptos y anclaje visual, habilidades que los tutores reales utilizan a diario.
2026-08-02
Corpus Messier
957,253 registros no pueden ocultar la brecha: los agentes de IA avanzan en programación pero se estancan donde las empresas los necesitan
El corpus Messier, con 957,253 registros en 30 puntos de referencia, revela un progreso desigual de los agentes de IA: la llamada a funciones está saturada, la programación mejora más rápido y los flujos de trabajo empresariales se quedan atrás. También muestra que la agregación estricta de aprobación total puede ocultar ganancias y alterar los rankings de las tablas de clasificación.
2026-08-02
Benchmark TRACTA
El razonamiento neuro-simbólico supera a los modelos neuronales puros en tareas temporales, según un benchmark
El benchmark TRACTA revela que la IA neuro-simbólica supera a los modelos neuronales puros en tres tareas de razonamiento temporal, con los mayores márgenes en alerta temprana y detección de patrones.
2026-08-02
Inteligencia Artificial
La generación de ideas de investigación mejora 3,89 veces con IDEAgent
IDEAgent utiliza linajes, retroalimentación multiobjetivo y memoria secuencial para equilibrar calidad y diversidad en ideas de investigación generadas por LLM. Probado en 32 temas en 8 dominios de CS, logra 3,89 veces el Rendimiento (ideas diversas por encima de un umbral de calidad) de métodos anteriores.
2026-08-02
IA Geoespacial
La plataforma OlmoEarth de Ai2 convierte la inferencia satelital en un problema de sistemas distribuidos
La plataforma OlmoEarth de Ai2 aborda la escala única de la inferencia geoespacial dividiendo el trabajo en preparación de datos impulsada por CPU, inferencia en GPU y posprocesamiento en CPU. Un mapa de riesgo de incendios forestales a escala continental se ejecutó con una aceleración de 155x a una fracción de centavo por kilómetro cuadrado. La arquitectura, la tolerancia a fallos y la hoja de ruta muestran cómo el equipo está operacionalizando modelos fundacionales para organizaciones ambientales.
2026-08-02
Enrutamiento de IA
Para la IA agéntica, el enrutamiento por llamada es el punto ciego. TRACE-Router tiene una solución.
Un nuevo marco de enrutamiento, TRACE-Router, aborda el desajuste entre los enrutadores de LLM por llamada y las métricas de éxito a nivel de tarea en la IA agéntica, obteniendo hasta 8 puntos de precisión y un 36% menos de latencia.
2026-08-01
Ciberseguridad
La IA que promete eliminar el 80% de tu backlog de seguridad
El servicio de remediación impulsado por Devin de LTM y Cognition promete eliminar el 80% de los backlogs de CVE con un 30% menos de costo. Pero la asociación solo apunta primero a correcciones de alta confianza, y cada parche requiere la aprobación humana. Examinamos si la IA realmente puede escalar la gestión de vulnerabilidades.
2026-08-01