Tests & BenchmarksFeatured2 min read
Analyse de benchmark
5 millions de votes, 25 points Elo : Dans les coulisses du classement Chatbot Arena que personne ne peut ébranler
LMSYS Chatbot Arena classe les modèles selon les préférences humaines en aveugle sur une échelle Elo, avec près de cinq millions de votes qui resserrent désormais les meilleurs laboratoires dans une bande de 25 points. Les méthodes LLM-en-tant-que-Juge qui permettent de passer à l'échelle cette évaluation comportent leurs propres biais documentés en faveur de la verbosité et de la position.
2026-08-02