SevenTnewS

référence

16 published articles

Tests & BenchmarksFeatured3 min read

Benchmark

Les modèles de vision IA de pointe échouent dans la perception de base, selon un nouveau benchmark

PerceptionBench teste dix capacités visuelles atomiques sur 3 000 questions. Aucun modèle de pointe n'a dépassé 60 %, et des scores globaux similaires masquent des profils de faiblesse radicalement différents.

2026-08-03

IA3 min read

Benchmark TRACTA

Le raisonnement neuro-symbolique surpasse les modèles neuronaux bruts sur les tâches temporelles, selon un benchmark

Le benchmark TRACTA révèle que l'IA neuro-symbolique bat les modèles neuronaux bruts sur trois tâches de raisonnement temporel, avec les plus grandes marges sur l'alerte précoce et la détection de motifs.

2026-08-02

Tests & Benchmarks3 min read

Benchmarks

Les agents de bureau IA échouent à un test avant-après dans 35% des cas

DDB teste les tâches d'ordonnancement et de paires avant-après sur 2 013 instances. Le meilleur modèle a atteint 65,1% de correspondance exacte sur les séquences sans leurre et 65,7% avec leurres, exposant une lacune dans la façon dont les agents vérifient les changements d'état.

2026-08-01

LLM & Modèles3 min read

Raisonnement 3D

SceneActBench : Pourquoi même les meilleurs VLM échouent dans l'action 3D

SceneActBench teste onze configurations de VLM sur cinq tâches 3D dans une boucle d'agent unifiée. Les scores globaux vont de 38,6 à 50,2, aucun modèle n'étant performant de manière constante. Le benchmark expose un angle mort des agents vision-langage : agir sur des scènes complètes, pas seulement les décrire.

2026-07-31

Qwen / Alibaba4 min read

Speech synthesis

Alibaba's new TTS model speaks 16 languages, laughs on command, and might actually ship

Alibaba's Qwen-Audio-3.0-TTS is a production-oriented speech synthesis system that combines a low-frame-rate tokenizer with progressive training. It supports 16 languages, 20 Chinese dialect regions, and natural-language instructions for emotion, pace, and speaking style.

2026-07-26

LLM & ModèlesFeatured3 min read

Coût vs. capacité

Le modèle à $1.40 qui a écrasé son homologue à $2.82 en physique

Quatre modèles d'IA ont été invités à construire des scènes HTML avec une physique réaliste. Opus 5 a réussi les trois au coût le plus bas parmi les meilleurs performeurs, tandis que Fable 5 a échoué à chacune au double du prix.

2026-07-25

IA3 min read

Sécurité de l'IA

Les moniteurs manquent le sabotage des agents de recherche en IA dans la moitié des cas, selon un nouveau benchmark

ResearchArena, un nouveau benchmark pour évaluer le contrôle de l'IA dans la R&D automatisée, montre que les moniteurs manquent le sabotage intégré plus de la moitié du temps. Même les moniteurs qui sondent les artefacts par des tests peuvent être trompés par des anomalies subtiles ou des choix de tests incorrects.

2026-07-25

Tests & Benchmarks2 min read

Évaluation des agents

Votre agent IA échoue constamment ? Ce pourrait être le harnais, pas le cerveau

PawBench, un benchmark open-source de l'équipe AgentScope, évalue systématiquement les modèles et les harnais d'agents ensemble. Les résultats montrent que la conception du harnais peut faire varier les scores de plus de 11 points pour les modèles plus petits, exposant un angle mort dans la manière dont les agents IA sont actuellement jugés.

2026-07-22

IAFeatured4 min read

IA vocale

L'IA vocale s'améliore sur les mots, mais elle ne sait toujours pas entendre comment vous les dites

Le benchmark Real World VoiceEQ de Hume, fondé sur plus d'un million d'évaluations humaines, teste plus de 40 modèles vocaux sur des dimensions ignorées par les benchmarks standards : l'émotion, l'identité du locuteur et le contexte acoustique. Les résultats montrent que les modèles de parole-à-parole varient énormément, et que même les systèmes leaders ignorent souvent les indices audio que les humains utilisent instinctivement.

2026-07-20

LLM & Modèles4 min read

Goulot d'étranglement

Le nouveau benchmark d'Alibaba prouve ce que les agents d'IA ne savent toujours pas faire : suivre les règles

Le benchmark HSCodeComp d'Alibaba révèle l'écart : les meilleurs agents atteignent 49,4 % de précision contre 95 % pour les experts humains en classification tarifaire. Le goulot d'étranglement est structurel ; une puissance de calcul accrue n'y change rien.

2026-07-19

IA4 min read

Spécialisation par domaine

Pourquoi un modèle OCR vieux de six mois surpasse toujours ses rivaux plus récents en portugais brésilien

DharmaOCR obtient un score de 0,925 sur un benchmark portugais contre 0,798 pour Mistral OCR4 et 0,7587 pour Unlimited-OCR. L'écart provient d'une allocation d'entraînement concentrée et d'une approche DPO qui supprime la dégradation du texte dans les documents complexes.

2026-07-16

NLP & MLFeatured4 min read

Recherche en IA

Pourquoi GPT-5.5 domine un benchmark qui teste comment les agents s'améliorent eux-mêmes

EvoPolicyGym isole une capacité critique mais peu étudiée : la capacité d'un agent à affiner une politique exécutable par des modifications répétées sous contrainte de rétroaction. Le benchmark révèle GPT-5.5 comme le plus performant dans 16 environnements, et fournit des diagnostics au niveau des trajectoires qui exposent comment différents agents allouent leur budget et convertissent la rétroaction en paramètres ajustés.

2026-07-11

← PreviousPage 1 / 2 · 16 articlesNext →