SevenTnewS

Benchmarks d'IA

19 published articles

Laboratoires & Recherche1 min read

Analyse

Benchmarks, pas des bonnes affaires : les laboratoires d'IA chinois atteignent la parité

Les laboratoires chinois d'IA Qwen, DeepSeek, MiniMax et Kimi ont égalé ou battu les modèles de pointe américains dans les benchmarks de raisonnement, codage et analyse de documents. Avec une tarification agressive et des stratégies open-weight, ils ne sont plus de simples alternatives bon marché, ce sont de véritables concurrents.

2026-07-27

LLM & ModèlesFeatured3 min read

IA Open Source

Kimi K3 est le plus grand modèle open source jamais créé. Il n'est toujours pas le meilleur.

Kimi K3 est le plus grand modèle open source avec 2,8 billions de paramètres, mais il ne parvient pas à battre les meilleurs modèles propriétaires sur les benchmarks globaux. Bien qu'il excelle sur des tâches spécifiques de codage et d'agents, l'écart avec les leaders de pointe comme Claude Fable 5 et GPT 5.6 Sol expose les limites du passage à l'échelle sans percées architecturales et de données.

2026-07-27

IA4 min read

Intelligence Artificielle

Quatre agents valent mieux qu'un : ARCANA résout ARC-AGI-2 en se parlant à elle-même

Des chercheurs de plusieurs institutions proposent ARCANA, un système multi-agent qui décompose les casse-têtes ARC-AGI-2 en perception, génération d'hypothèses, exécution symbolique et raffinement réfléchi. Son architecture modulaire et son méta-contrôleur appris améliorent l'efficacité du raisonnement, mais l'article laisse des questions clés sur la généralisation et le coût de calcul sans réponse.

2026-07-19

IA1 min read

Orchestrator swap

Perplexity fait de Grok 4.5 son principal modèle orchestreur dans Computer, surpassant Opus 4.8 à moitié prix

Perplexity affirme que Grok 4.5 a surpassé cinq autres configurations d'orchestreur sur son benchmark interne WANDR, dépassant Claude Opus 4.8 en précision à environ la moitié du coût, et est désormais disponible dans Computer pour les abonnés Pro et Max.

2026-07-14

IAFeatured1 min read

Benchmark integrity

GPT-5.6 Sol (max) domine CritPt, un nouveau benchmark de problèmes inédits de recherche en physique

GPT-5.6 Sol (max) mène CritPt, un nouveau benchmark de physique bâti sur des problèmes inédits de recherche de niveau graduate, obtenant environ 5 points de plus que GPT-5.5 et 4 points d'avance sur Claude Fable 5, selon des tests indépendants d'Artificial Analysis.

2026-07-13

VibeCoding7 min read

Déploiement de l'IA de pointe

Claude Fable 5 et Mythos 5 : l'avenir de l'IA est une intelligence cloisonnée

Le Claude Fable 5 d'Anthropic offre aux utilisateurs publics des capacités de classe Mythos, tandis que le Mythos 5 reste en accès limité et de confiance. Le modèle de déploiement, le routage des capacités, les classificateurs de repli et l'accès hiérarchisé représentent un changement fondamental dans la manière dont l'IA de pointe est diffusée et utilisée.

2026-07-10

IA4 min read

Intelligence Artificielle

IFBench : le nouveau benchmark testant le respect des instructions par l'IA

IFBench mesure la capacité des modèles de langage à suivre des instructions précises en langage naturel, une capacité clé mais souvent négligée. Les premiers résultats montrent les modèles Grok de xAI en tête, tandis que les modèles Claude sont à la traîne malgré des scores d'intelligence globale élevés.

2026-07-07

← PreviousPage 4 / 2 · 19 articlesNext →