hallucination
2 published articles
Tests & Benchmarks4 min read
Benchmark de raisonnement financier
Les LLM connaissent les formules comptables. FinIndices montre qu'ils ne savent pas les appliquer
Les LLM peuvent réciter des formules comptables, mais FinIndices, un benchmark construit sur de véritables états financiers chinois, montre qu'ils peinent à les appliquer. La précision de Gemini-3.1-Pro est passée de 70,70 % à 38,22 % lorsque les indices de formules ont été retirés, et la génération de tableaux a activement dégradé le raisonnement des modèles.
2026-08-20
Tests & BenchmarksFeatured3 min read
Benchmark
Les modèles de vision IA de pointe échouent dans la perception de base, selon un nouveau benchmark
PerceptionBench teste dix capacités visuelles atomiques sur 3 000 questions. Aucun modèle de pointe n'a dépassé 60 %, et des scores globaux similaires masquent des profils de faiblesse radicalement différents.
2026-08-03