Prueba de referencia de IA
5 published articles
Evaluaciones de Bioseguridad
Los agentes de IA suspendieron una prueba sobre vigilancia de patógenos. Eso debería preocuparnos
BioSecBench-Surveillance probó dieciséis configuraciones de agentes de IA en 100 tareas de vigilancia genómica. Los mejores obtuvieron solo alrededor del 50 % de precisión. Los errores no provinieron de elegir el flujo de trabajo incorrecto, sino de las decisiones periféricas: referencias, umbrales, filtros, que los humanos dan por sentados.
2026-07-25
Codificación agéntica
Cómo Grok 4.5 se adelantó en el SWE Marathon, y qué significa para los agentes de codificación
Grok 4.5 ahora lidera la tabla de clasificación de SWE Marathon, superando a Claude 4 Opus y GPT-5. El referente evalúa habilidades reales de ingeniería de software: corrección de errores, adición de funciones y comprensión de código en repositorios reales. El resultado redefine el panorama competitivo de los agentes de codificación de IA.
2026-07-20
Análisis de investigación
Corrupción de documentos por IA en flujos de trabajo delegados: lo que revela una nueva prueba de estrés
El punto de referencia DELEGATE-52 evalúa sistemas de IA en tareas de edición de documentos delegadas de largo alcance, encontrando que los modelos frontera acumulan una pérdida de fidelidad semántica del 19, 34% en 20 iteraciones. Los flujos de trabajo en Python mostraron menos del 1% de degradación en promedio, pero el estudio subraya que la delegación confiable a largo plazo sigue siendo un desafío abierto.
2026-07-04
Análisis profundo de benchmarks
ARC-AGI-2: El benchmark que mide la inteligencia fluida en sistemas de IA
ARC-AGI-2 prueba la inteligencia fluida de los sistemas de IA mediante rompecabezas en cuadrículas visuales que no pueden resolverse por memorización. Los modelos frontera actuales puntúan entre 75 y 85%, pero el gran premio de 700.000 dólares sigue sin reclamarse. Aquí un análisis profundo del diseño del benchmark, la puntuación y la tabla de clasificación actual.
2026-07-01
Código abierto
El primer agente web de código abierto que no necesita HTML acaba de superar a GPT-4o
Los agentes MolmoWeb, disponibles en tamaños de 4B y 8B, se entrenaron con MolmoWebMix, un nuevo conjunto de datos que combina más de 130,000 demostraciones sintéticas y humanas. Superan a los modelos cerrados y establecen nuevos estándares para la investigación abierta de agentes web.
2026-04-10