Tests & Benchmarks3 min read
Benchmarks
Les agents de bureau IA échouent à un test avant-après dans 35% des cas
DDB teste les tâches d'ordonnancement et de paires avant-après sur 2 013 instances. Le meilleur modèle a atteint 65,1% de correspondance exacte sur les séquences sans leurre et 65,7% avec leurres, exposant une lacune dans la façon dont les agents vérifient les changements d'état.
2026-08-01