SevenTnewS

Laboratoire

Recherche, expérimentation et open source : hardware, IoT, robotique, biotech et IA embarquée.

47 published articles

5 min read

Hardware grand public

CMF, Elektron et OhSnap montrent que le matériel économique bat l'inflation de fonctionnalités

Les écouteurs Clip Pro à 79 $ de CMF, les grooveboxes Model à 349 $ d'Elektron et le Snap Grip Stand à 50 $ d'OhSnap ont tous conquis les critiques de The Verge en assumant leurs compromis. Le même schéma se retrouve dans les lunettes de réalité augmentée. Les acheteurs devraient en prendre note.

2026-08-23

4 min read

Benchmark de raisonnement financier

Les LLM connaissent les formules comptables. FinIndices montre qu'ils ne savent pas les appliquer

Les LLM peuvent réciter des formules comptables, mais FinIndices, un benchmark construit sur de véritables états financiers chinois, montre qu'ils peinent à les appliquer. La précision de Gemini-3.1-Pro est passée de 70,70 % à 38,22 % lorsque les indices de formules ont été retirés, et la génération de tableaux a activement dégradé le raisonnement des modèles.

2026-08-20

4 min read

HDR10+ ADVANCED : Samsung et Prime Video le lancent en premier

Les métadonnées scène par scène peuvent-elles réparer la mauvaise réputation du motion smoothing ?

Prime Video est le premier service de streaming à adopter HDR10+ ADVANCED sur les téléviseurs Samsung 2026 à partir d'août 2026. Le standard ajoute Enhanced Overall Brightness et Intelligent Motion Smoothing, le paramètre à la pire réputation du home cinéma, désormais soutenu par des métadonnées plus intelligentes.

2026-08-11

5 min read

IA dans l'éducation

Les tuteurs IA aident trop par conception. Un nouveau benchmark le quantifie

Un benchmark construit sur 462 séances de tutorat réelles révèle que les tuteurs IA font par défaut le travail à la place des élèves. Une consigne explicite aide, mais les modèles peinent toujours sur le jugement central : quand pousser, quand étayer, quand reculer.

2026-08-10

5 min read

Agents vocaux

Pourquoi Grok 4.1 Fast bat des modèles plus intelligents au téléphone

Les classements généraux choisissent les mauvais LLM pour les appels vocaux. Le classement 2026 de BenchLM place la latence en premier : Grok 4.1 Fast répond en 0.54s tandis que Claude Opus 4.6, le meilleur scoreur, a besoin de 1.78s. Les modèles rapides mènent la conversation ; les modèles de raisonnement restent sur les appels d'outils en arrière-plan.

2026-08-05

Featured5 min read

Évaluation IA

Les anciens benchmarks IA ont cassé. Voici ce qui les a remplacés.

Les benchmarks statiques comme MMLU et GSM8K sont saturés et contaminés. L'industrie s'est tournée vers la régénération dynamique, les examens de niveau expert et les environnements de tâches agentiques pour obtenir une véritable mesure de la capacité de l'IA.

2026-08-04

Featured3 min read

Architecture & Cloud

Pourquoi votre tableau de bord IoT affiche les données d'hier et comment y remédier

La plupart des plateformes de surveillance IoT échouent non pas au niveau de la collecte de données mais de la livraison fiable. Une architecture en couches utilisant Alibaba Cloud DataWorks automatise la synchronisation planifiée, élimine les risques comme la duplication et la latence, et maintient vos tableaux de bord à jour sans middleware personnalisé.

2026-08-03

Featured8 min read

Rapport spécial : Évaluation de l'IA

L'état du benchmarking IA en 2026 : l'effondrement des tests statiques et les systèmes conçus pour les remplacer

Un tour d'horizon complet du paysage du benchmarking IA en 2026 : pourquoi MMLU, GSM8K et HumanEval ont cassé, comment les benchmarks dynamiques et les examens d'experts comme HLE et GPQA Diamond les ont remplacés, ce que révèlent les tests agentiques et d'intelligence irrégulière, et comment les préférences humaines, les juges LLM et l'observabilité en production complètent désormais la pile d'évaluation complète.

2026-08-03

Featured3 min read

Benchmark

Les modèles de vision IA de pointe échouent dans la perception de base, selon un nouveau benchmark

PerceptionBench teste dix capacités visuelles atomiques sur 3 000 questions. Aucun modèle de pointe n'a dépassé 60 %, et des scores globaux similaires masquent des profils de faiblesse radicalement différents.

2026-08-03

Featured2 min read

Analyse de benchmark

LiveBench refuse de rester figé. C'est tout l'intérêt

LiveBench remplace un corrigé fixe par un pool continuellement actualisé de problèmes de codage, de dépôts et de questions de prédiction, contournant la contamination qui a miné MMLU et GSM8K. Cela fait partie d'un virage plus large vers l'évaluation dynamique, aux côtés de LiveCodeBench, ForecastBench et LLMEval-Fair.

2026-08-03

4 min read

Test de modèle

Qwen2.5-Omni : le modèle open-source qui tient enfin ce que ses concurrents promettent seulement

Analyse approfondie du modèle open-source qui traite simultanément texte, images, audio et vidéo tout en générant un flux de parole, surpassant GPT-4o-mini et Gemini sur plusieurs benchmarks, tout en tenant sur un seul GPU grand public avec quantification.

2026-08-03

Featured2 min read

Analyse de benchmark

5 millions de votes, 25 points Elo : Dans les coulisses du classement Chatbot Arena que personne ne peut ébranler

LMSYS Chatbot Arena classe les modèles selon les préférences humaines en aveugle sur une échelle Elo, avec près de cinq millions de votes qui resserrent désormais les meilleurs laboratoires dans une bande de 25 points. Les méthodes LLM-en-tant-que-Juge qui permettent de passer à l'échelle cette évaluation comportent leurs propres biais documentés en faveur de la verbosité et de la position.

2026-08-02

← PreviousPage 1 / 4 · 47 articlesNext →