Pruebas y Benchmarks3 min read
Evaluaciones
Los agentes de escritorio con IA fallan en la prueba de antes-después el 35% de las veces
DDB prueba tareas de ordenamiento y pares antes-después en 2,013 instancias. El mejor modelo alcanzó un 65.1% de coincidencia exacta en secuencias sin señuelo y 65.7% con señuelos, exponiendo una brecha en cómo los agentes verifican los cambios de estado.
2026-08-01