LLM & Modèles4 min read
Goulot d'étranglement
Le nouveau benchmark d'Alibaba prouve ce que les agents d'IA ne savent toujours pas faire : suivre les règles
Le benchmark HSCodeComp d'Alibaba révèle l'écart : les meilleurs agents atteignent 49,4 % de précision contre 95 % pour les experts humains en classification tarifaire. Le goulot d'étranglement est structurel ; une puissance de calcul accrue n'y change rien.
2026-07-19