pruebas de rendimiento
2 published articles
Investigación en IA
El cuello de botella que frena a los agentes de IA no es la exploración, sino la evaluación
Dos nuevos artículos de Hugging Face abordan el mismo problema central desde direcciones opuestas: cómo lograr que los agentes de IA evalúen de forma fiable sus propias acciones. AJ-Bench construye un punto de referencia para agentes jueces conscientes del entorno, mientras que HeavySkill sostiene que el mejor juez reside dentro de los parámetros del modelo.
2026-07-17
Evaluación de agentes
Los benchmarks en entornos controlados ocultan cómo fallan realmente los agentes: HKU acaba de construir la solución
UniClawBench evalúa agentes proactivos en cinco capacidades fundamentales a través de 400 tareas bilingües del mundo real, utilizando contenedores Docker en vivo y una evaluación de circuito cerrado con tres agentes. Desenreda las habilidades del modelo base de las elecciones del marco, revelando dónde se rompen realmente los agentes.
2026-07-13