SevenTnewS

Benchmarks

20 published articles

IAFeatured5 min read

IA locale

Le paradoxe du modèle non censuré : moins de refus, moins de sécurité, et pourquoi l'IA locale reste importante

Le benchmarking de cinq LLM non censurés exécutés localement montre que l'abliteration réduit les sur-refus de 44 % à près de zéro sans impact sur le raisonnement, mais la même modification fait chuter les refus de sécurité de 41,5 % à 9,5 %, car les deux reposent sur la même direction interne. La véritable raison d'utiliser un modèle non censuré n'est peut-être pas celle que vous pensez.

2026-07-19

LLM & ModèlesFeatured6 min read

analyse

Là où Kimi K3 dépasse la frontière : un regard benchmark par benchmark sur le modèle ouvert 2,8T

Kimi K3, le modèle ouvert de 2,8 billions de paramètres de Moonshot AI, est à la traîne des modèles propriétaires de pointe sur la plupart des benchmarks généraux, mais mène sur SWE Marathon, Terminal-Bench 2.1, BrowseComp, et d'autres. Le tableau détaillé révèle où ses paris architecturaux sur KDA et Stable LatentMoE portent leurs fruits.

2026-07-17

LLM & Modèles7 min read

Intelligence Artificielle

Ce qu'Inkling révèle sur la nouvelle ligne de partage du marché des modèles open-source

Inkling est le premier modèle ouvertement disponible de près de 1 000 milliards de paramètres avec entrée native audio, image et texte, aux côtés d'une fenêtre de contexte de 1 million de tokens et d'une variante quantifiée NVFP4. Les scores bruts des benchmarks sont solides, mais l'histoire la plus révélatrice est la manière dont l'écosystème open-source est passé d'un acteur de rattrapage à une concurrence active à la frontière, et où Inkling s'insère dans cette nouvelle carte.

2026-07-15

IA5 min read

Intelligence artificielle

Sonnet 4.6 vient de rendre Opus coûteux. Cela change tout.

Le Claude Sonnet 4.6 d'Anthropic atteint ou dépasse les performances de la classe Opus sur des benchmarks clés tout en conservant le même prix que Sonnet 4.5. Les données de préférence des développeurs et les témoignages clients suggèrent que le modèle remplace déjà des alternatives plus coûteuses pour des tâches agentiques et de codage réelles.

2026-07-14

IAFeatured4 min read

IA générative

CO2Jump de Google marie la génération de texte et d'image en un seul passage qui s'auto-corrige à la volée

Google présente CO2Jump, un sampler sans entraînement pour la génération conjointe de texte et d'image. Il utilise un processus de saut de Markov auto-correcteur où les scores de confiance de chaque modalité guident les mises à jour de l'autre en temps réel, produisant des sorties multimodales cohérentes en un seul passage. La méthode apporte également trois nouveaux ensembles de données de référence pour l'évaluation de la génération conjointe.

2026-07-14

Anthropic / ClaudeFeatured4 min read

Lancement d'un modèle d'IA

Anthropic lance Claude Sonnet 5 : un modèle plus agentique à un prix compétitif

Anthropic publie Claude Sonnet 5, un modèle qui réduit l'écart avec les modèles de classe Opus sur les tâches agentiques comme le codage, l'utilisation d'outils et le raisonnement. Proposé à un prix compétitif, il est lancé aujourd'hui sur tous les forfaits et l'API Claude.

2026-07-10

IA3 min read

Intelligence Artificielle

Kimi K2.7 Code est plus rapide et moins cher. Mais le codage open-source vient de se heurter à un mur appelé GPT-5.5.

Le Kimi K2.7 Code de Moonshot AI réalise des gains importants sur les tâches de codage à long horizon avec 30 % de gaspillage de jetons en moins. Pourtant, GPT-5.5 et Claude Opus 4.8 restent en tête sur les principaux benchmarks, soulignant les compromis réels des décisions open-source.

2026-07-09

Laboratoires & Recherche4 min read

Plongée dans une nouvelle prépublication

Ce que le prépublication 2606.23050, vieille de 5 jours, nous dit sur l'avenir de l'IA

Une prépublication de 33 pages, le document 2606.23050, publiée il y a seulement cinq jours, marque une contribution sérieuse à la recherche en IA. Cet article décortique sa méthodologie, ses principales conclusions et ce qu'elle signifie pour la trajectoire de l'apprentissage automatique et du traitement du langage naturel.

2026-07-07

← PreviousPage 3 / 2 · 20 articlesNext →