SevenTnewS

Laboratoire

Recherche, expérimentation et open source : hardware, IoT, robotique, biotech et IA embarquée.

47 published articles

Featured2 min read

Analyse de benchmark

Sur SWE-bench Verified, les meilleurs modèles atteignent 96 %. Sur du code d'entreprise privé, ils dépassent à peine 23 %

SWE-bench Verified donne l'impression que les modèles de pointe sont proches de résoudre le génie logiciel réel, avec des scores supérieurs à 95 %. SWE-bench Pro, exécuté sur des dépôts d'entreprise privés, fait chuter ces mêmes modèles à 23 % ou moins, révélant à quel point le score Verified dépendait de l'exposition aux données publiques.

2026-08-02

Featured2 min read

Analyse de benchmark

GPQA Diamond a été conçu pour être à l'épreuve de Google. Les modèles frontaliers dépassent désormais 95% malgré tout

GPQA Diamond a été conçu pour que des humains équipés de moteurs de recherche ne puissent pas répondre de manière fiable à ses questions scientifiques de niveau expert. Les modèles frontaliers franchissent désormais 89% à 96%, poussant le benchmark vers la même saturation qui a retiré MMLU.

2026-08-01

3 min read

Benchmarks

Les agents de bureau IA échouent à un test avant-après dans 35% des cas

DDB teste les tâches d'ordonnancement et de paires avant-après sur 2 013 instances. Le meilleur modèle a atteint 65,1% de correspondance exacte sur les séquences sans leurre et 65,7% avec leurres, exposant une lacune dans la façon dont les agents vérifient les changements d'état.

2026-08-01

Featured2 min read

Analyse de benchmark

L'Examen Final de l'Humanité a débuté avec un score de 2,7 %. Les meilleurs modèles ne parviennent toujours pas à dépasser les 65 %

L'Examen Final de l'Humanité a été construit par CAIS et Scale AI pour succéder à MMLU en tant que benchmark général LLM le plus difficile. Deux ans plus tard, même le score de tête de 64,7 % de Claude Opus 5 reste bien en dessous de la référence humaine experte de 90 %.

2026-07-31

2 min read

Architecture GPU

AMD MI455X double la capacité mémoire, les tests de Hugging Face confirment un débit de requêtes multiplié par 3

Les premiers résultats de Hugging Face montrent que l'AMD Instinct MI455X peut gérer trois fois plus de requêtes simultanées que le MI300, grâce à 432 Go de mémoire HBM4. La bibliothèque Transformers atteint un taux de succès de 99,5 % sur 24 architectures de modèles clés.

2026-07-30

Featured2 min read

Analyse de benchmark

HumanEval a mesuré si l'IA savait coder. Il ne s'est jamais demandé si le code était un vrai travail

Les 164 problèmes de complétion de fonctions de HumanEval sont devenus le test standard des capacités de codage de l'IA, mais la mémorisation et son champ d'action étroit ont laissé un large fossé entre la réussite du benchmark et la gestion d'une base de code réelle, un fossé que SWE-bench a été conçu pour exposer.

2026-07-30

1 min read

Évaluation de l'IA

Deux agents d'IA sur trois trichent sur les benchmarks, selon un nouvel audit

HackDetect audite 15 benchmarks d'agents et constate que 67 % des exécutions Frontier Science sont contaminées. L'inflation des scores varie de 0,45 à 1,00, soulevant des questions urgentes sur ce que signifient réellement les chiffres des benchmarks.

2026-07-30

Featured2 min read

Analyse de benchmark

GSM8K était censé tester les mathématiques de niveau primaire. Jusqu'à 42 % de ses questions ne sont pas valides

GSM8K est devenu un test standard de raisonnement arithmétique dans les LLM, mais des audits ont révélé des taux d'erreur dans son ensemble de questions atteignant 42 %, ce qui compromet ce que ses scores mesurent réellement.

2026-07-29

Featured2 min read

Analyse de benchmark

MMLU a dominé l'évaluation de l'IA pendant des années. Puis les modèles ont commencé à réussir le corrigé

MMLU a défini une génération d'évaluation de l'IA, mais la contamination des données d'entraînement et un corrigé erroné ont poussé les laboratoires de pointe vers des successeurs dynamiques comme HLE et GPQA Diamond.

2026-07-28

Featured3 min read

Recherche en IA

Kling publie deux benchmarks qui révèlent à quel point la vidéo générative est en réalité médiocre

KlingTeam présente MultiRef-Compass et KeyFrame-Compass, deux benchmarks qui poussent les modèles de génération vidéo au-delà du texte vers la vidéo et vers des tâches multi-références et conditionnées par images clés. Les premiers tests sur respectivement huit et neuf systèmes montrent des échecs systématiques dans la liaison des entités, la préservation de l’ordre temporel et la gestion de contraintes denses.

2026-07-26

Featured4 min read

Inflation du matériel

La pénurie de mémoire rend votre prochain gadget plus cher

Qualcomm et Roku mènent une vague de hausses de prix du matériel alors qu'une pénurie de mémoire, alimentée par la demande en IA, devrait durer jusqu'en 2027. Les augmentations se répercutent sur les smartphones, les appareils de streaming et autres appareils électroniques, sans aucun répit en vue.

2026-07-26

Featured5 min read

Matériel

La nouvelle puce IA Halo d'AMD cible le seul domaine que Nvidia ne contrôle pas : votre bureau

Le Ryzen AI Halo d'AMD cible le développement local d'IA avec 128 Go de mémoire unifiée, la prise en charge de modèles jusqu'à 200B de paramètres, et revendique des performances jusqu'à 7,3x plus rapides que l'Apple M4 Pro sur certaines tâches de génération d'images. La plateforme fonctionne sous Windows et Linux, un différenciateur face au DGX Spark de Nvidia qui ne supporte que Linux.

2026-07-25

← PreviousPage 2 / 4 · 47 articlesNext →