Pruebas y BenchmarksFeatured2 min read
Análisis de Benchmark
5 Millones de Votos, 25 Puntos Elo: Dentro del Leaderboard de Chatbot Arena que Nadie Puede Sacudir
LMSYS Chatbot Arena clasifica modelos por preferencia humana ciega en una escala Elo, con casi cinco millones de votos que ahora agrupan los principales laboratorios en una banda de 25 puntos. Los métodos LLM-as-a-Judge que escalan este tipo de evaluación tienen sus propios sesgos documentados hacia la verbosidad y la posición.
2026-08-02