référence
16 published articles
Benchmark
Les modèles de vision IA de pointe échouent dans la perception de base, selon un nouveau benchmark
PerceptionBench teste dix capacités visuelles atomiques sur 3 000 questions. Aucun modèle de pointe n'a dépassé 60 %, et des scores globaux similaires masquent des profils de faiblesse radicalement différents.
2026-08-03
Benchmark TRACTA
Le raisonnement neuro-symbolique surpasse les modèles neuronaux bruts sur les tâches temporelles, selon un benchmark
Le benchmark TRACTA révèle que l'IA neuro-symbolique bat les modèles neuronaux bruts sur trois tâches de raisonnement temporel, avec les plus grandes marges sur l'alerte précoce et la détection de motifs.
2026-08-02
Benchmarks
Les agents de bureau IA échouent à un test avant-après dans 35% des cas
DDB teste les tâches d'ordonnancement et de paires avant-après sur 2 013 instances. Le meilleur modèle a atteint 65,1% de correspondance exacte sur les séquences sans leurre et 65,7% avec leurres, exposant une lacune dans la façon dont les agents vérifient les changements d'état.
2026-08-01
Raisonnement 3D
SceneActBench : Pourquoi même les meilleurs VLM échouent dans l'action 3D
SceneActBench teste onze configurations de VLM sur cinq tâches 3D dans une boucle d'agent unifiée. Les scores globaux vont de 38,6 à 50,2, aucun modèle n'étant performant de manière constante. Le benchmark expose un angle mort des agents vision-langage : agir sur des scènes complètes, pas seulement les décrire.
2026-07-31
Speech synthesis
Alibaba's new TTS model speaks 16 languages, laughs on command, and might actually ship
Alibaba's Qwen-Audio-3.0-TTS is a production-oriented speech synthesis system that combines a low-frame-rate tokenizer with progressive training. It supports 16 languages, 20 Chinese dialect regions, and natural-language instructions for emotion, pace, and speaking style.
2026-07-26
Coût vs. capacité
Le modèle à $1.40 qui a écrasé son homologue à $2.82 en physique
Quatre modèles d'IA ont été invités à construire des scènes HTML avec une physique réaliste. Opus 5 a réussi les trois au coût le plus bas parmi les meilleurs performeurs, tandis que Fable 5 a échoué à chacune au double du prix.
2026-07-25
Sécurité de l'IA
Les moniteurs manquent le sabotage des agents de recherche en IA dans la moitié des cas, selon un nouveau benchmark
ResearchArena, un nouveau benchmark pour évaluer le contrôle de l'IA dans la R&D automatisée, montre que les moniteurs manquent le sabotage intégré plus de la moitié du temps. Même les moniteurs qui sondent les artefacts par des tests peuvent être trompés par des anomalies subtiles ou des choix de tests incorrects.
2026-07-25
Évaluation des agents
Votre agent IA échoue constamment ? Ce pourrait être le harnais, pas le cerveau
PawBench, un benchmark open-source de l'équipe AgentScope, évalue systématiquement les modèles et les harnais d'agents ensemble. Les résultats montrent que la conception du harnais peut faire varier les scores de plus de 11 points pour les modèles plus petits, exposant un angle mort dans la manière dont les agents IA sont actuellement jugés.
2026-07-22
IA vocale
L'IA vocale s'améliore sur les mots, mais elle ne sait toujours pas entendre comment vous les dites
Le benchmark Real World VoiceEQ de Hume, fondé sur plus d'un million d'évaluations humaines, teste plus de 40 modèles vocaux sur des dimensions ignorées par les benchmarks standards : l'émotion, l'identité du locuteur et le contexte acoustique. Les résultats montrent que les modèles de parole-à-parole varient énormément, et que même les systèmes leaders ignorent souvent les indices audio que les humains utilisent instinctivement.
2026-07-20
Goulot d'étranglement
Le nouveau benchmark d'Alibaba prouve ce que les agents d'IA ne savent toujours pas faire : suivre les règles
Le benchmark HSCodeComp d'Alibaba révèle l'écart : les meilleurs agents atteignent 49,4 % de précision contre 95 % pour les experts humains en classification tarifaire. Le goulot d'étranglement est structurel ; une puissance de calcul accrue n'y change rien.
2026-07-19
Spécialisation par domaine
Pourquoi un modèle OCR vieux de six mois surpasse toujours ses rivaux plus récents en portugais brésilien
DharmaOCR obtient un score de 0,925 sur un benchmark portugais contre 0,798 pour Mistral OCR4 et 0,7587 pour Unlimited-OCR. L'écart provient d'une allocation d'entraînement concentrée et d'une approche DPO qui supprime la dégradation du texte dans les documents complexes.
2026-07-16
Recherche en IA
Pourquoi GPT-5.5 domine un benchmark qui teste comment les agents s'améliorent eux-mêmes
EvoPolicyGym isole une capacité critique mais peu étudiée : la capacité d'un agent à affiner une politique exécutable par des modifications répétées sous contrainte de rétroaction. Le benchmark révèle GPT-5.5 comme le plus performant dans 16 environnements, et fournit des diagnostics au niveau des trajectoires qui exposent comment différents agents allouent leur budget et convertissent la rétroaction en paramètres ajustés.
2026-07-11