Benchmarks
20 published articles
IA locale
Le paradoxe du modèle non censuré : moins de refus, moins de sécurité, et pourquoi l'IA locale reste importante
Le benchmarking de cinq LLM non censurés exécutés localement montre que l'abliteration réduit les sur-refus de 44 % à près de zéro sans impact sur le raisonnement, mais la même modification fait chuter les refus de sécurité de 41,5 % à 9,5 %, car les deux reposent sur la même direction interne. La véritable raison d'utiliser un modèle non censuré n'est peut-être pas celle que vous pensez.
2026-07-19
analyse
Là où Kimi K3 dépasse la frontière : un regard benchmark par benchmark sur le modèle ouvert 2,8T
Kimi K3, le modèle ouvert de 2,8 billions de paramètres de Moonshot AI, est à la traîne des modèles propriétaires de pointe sur la plupart des benchmarks généraux, mais mène sur SWE Marathon, Terminal-Bench 2.1, BrowseComp, et d'autres. Le tableau détaillé révèle où ses paris architecturaux sur KDA et Stable LatentMoE portent leurs fruits.
2026-07-17
Intelligence Artificielle
Ce qu'Inkling révèle sur la nouvelle ligne de partage du marché des modèles open-source
Inkling est le premier modèle ouvertement disponible de près de 1 000 milliards de paramètres avec entrée native audio, image et texte, aux côtés d'une fenêtre de contexte de 1 million de tokens et d'une variante quantifiée NVFP4. Les scores bruts des benchmarks sont solides, mais l'histoire la plus révélatrice est la manière dont l'écosystème open-source est passé d'un acteur de rattrapage à une concurrence active à la frontière, et où Inkling s'insère dans cette nouvelle carte.
2026-07-15
Intelligence artificielle
Sonnet 4.6 vient de rendre Opus coûteux. Cela change tout.
Le Claude Sonnet 4.6 d'Anthropic atteint ou dépasse les performances de la classe Opus sur des benchmarks clés tout en conservant le même prix que Sonnet 4.5. Les données de préférence des développeurs et les témoignages clients suggèrent que le modèle remplace déjà des alternatives plus coûteuses pour des tâches agentiques et de codage réelles.
2026-07-14
IA générative
CO2Jump de Google marie la génération de texte et d'image en un seul passage qui s'auto-corrige à la volée
Google présente CO2Jump, un sampler sans entraînement pour la génération conjointe de texte et d'image. Il utilise un processus de saut de Markov auto-correcteur où les scores de confiance de chaque modalité guident les mises à jour de l'autre en temps réel, produisant des sorties multimodales cohérentes en un seul passage. La méthode apporte également trois nouveaux ensembles de données de référence pour l'évaluation de la génération conjointe.
2026-07-14
Lancement d'un modèle d'IA
Anthropic lance Claude Sonnet 5 : un modèle plus agentique à un prix compétitif
Anthropic publie Claude Sonnet 5, un modèle qui réduit l'écart avec les modèles de classe Opus sur les tâches agentiques comme le codage, l'utilisation d'outils et le raisonnement. Proposé à un prix compétitif, il est lancé aujourd'hui sur tous les forfaits et l'API Claude.
2026-07-10
Intelligence Artificielle
Kimi K2.7 Code est plus rapide et moins cher. Mais le codage open-source vient de se heurter à un mur appelé GPT-5.5.
Le Kimi K2.7 Code de Moonshot AI réalise des gains importants sur les tâches de codage à long horizon avec 30 % de gaspillage de jetons en moins. Pourtant, GPT-5.5 et Claude Opus 4.8 restent en tête sur les principaux benchmarks, soulignant les compromis réels des décisions open-source.
2026-07-09
Plongée dans une nouvelle prépublication
Ce que le prépublication 2606.23050, vieille de 5 jours, nous dit sur l'avenir de l'IA
Une prépublication de 33 pages, le document 2606.23050, publiée il y a seulement cinq jours, marque une contribution sérieuse à la recherche en IA. Cet article décortique sa méthodologie, ses principales conclusions et ce qu'elle signifie pour la trajectoire de l'apprentissage automatique et du traitement du langage naturel.
2026-07-07