Laboratoire
Recherche, expérimentation et open source : hardware, IoT, robotique, biotech et IA embarquée.
47 published articles
Hardware grand public
CMF, Elektron et OhSnap montrent que le matériel économique bat l'inflation de fonctionnalités
Les écouteurs Clip Pro à 79 $ de CMF, les grooveboxes Model à 349 $ d'Elektron et le Snap Grip Stand à 50 $ d'OhSnap ont tous conquis les critiques de The Verge en assumant leurs compromis. Le même schéma se retrouve dans les lunettes de réalité augmentée. Les acheteurs devraient en prendre note.
2026-08-23
Benchmark de raisonnement financier
Les LLM connaissent les formules comptables. FinIndices montre qu'ils ne savent pas les appliquer
Les LLM peuvent réciter des formules comptables, mais FinIndices, un benchmark construit sur de véritables états financiers chinois, montre qu'ils peinent à les appliquer. La précision de Gemini-3.1-Pro est passée de 70,70 % à 38,22 % lorsque les indices de formules ont été retirés, et la génération de tableaux a activement dégradé le raisonnement des modèles.
2026-08-20
HDR10+ ADVANCED : Samsung et Prime Video le lancent en premier
Les métadonnées scène par scène peuvent-elles réparer la mauvaise réputation du motion smoothing ?
Prime Video est le premier service de streaming à adopter HDR10+ ADVANCED sur les téléviseurs Samsung 2026 à partir d'août 2026. Le standard ajoute Enhanced Overall Brightness et Intelligent Motion Smoothing, le paramètre à la pire réputation du home cinéma, désormais soutenu par des métadonnées plus intelligentes.
2026-08-11
IA dans l'éducation
Les tuteurs IA aident trop par conception. Un nouveau benchmark le quantifie
Un benchmark construit sur 462 séances de tutorat réelles révèle que les tuteurs IA font par défaut le travail à la place des élèves. Une consigne explicite aide, mais les modèles peinent toujours sur le jugement central : quand pousser, quand étayer, quand reculer.
2026-08-10
Agents vocaux
Pourquoi Grok 4.1 Fast bat des modèles plus intelligents au téléphone
Les classements généraux choisissent les mauvais LLM pour les appels vocaux. Le classement 2026 de BenchLM place la latence en premier : Grok 4.1 Fast répond en 0.54s tandis que Claude Opus 4.6, le meilleur scoreur, a besoin de 1.78s. Les modèles rapides mènent la conversation ; les modèles de raisonnement restent sur les appels d'outils en arrière-plan.
2026-08-05
Évaluation IA
Les anciens benchmarks IA ont cassé. Voici ce qui les a remplacés.
Les benchmarks statiques comme MMLU et GSM8K sont saturés et contaminés. L'industrie s'est tournée vers la régénération dynamique, les examens de niveau expert et les environnements de tâches agentiques pour obtenir une véritable mesure de la capacité de l'IA.
2026-08-04
Architecture & Cloud
Pourquoi votre tableau de bord IoT affiche les données d'hier et comment y remédier
La plupart des plateformes de surveillance IoT échouent non pas au niveau de la collecte de données mais de la livraison fiable. Une architecture en couches utilisant Alibaba Cloud DataWorks automatise la synchronisation planifiée, élimine les risques comme la duplication et la latence, et maintient vos tableaux de bord à jour sans middleware personnalisé.
2026-08-03
Rapport spécial : Évaluation de l'IA
L'état du benchmarking IA en 2026 : l'effondrement des tests statiques et les systèmes conçus pour les remplacer
Un tour d'horizon complet du paysage du benchmarking IA en 2026 : pourquoi MMLU, GSM8K et HumanEval ont cassé, comment les benchmarks dynamiques et les examens d'experts comme HLE et GPQA Diamond les ont remplacés, ce que révèlent les tests agentiques et d'intelligence irrégulière, et comment les préférences humaines, les juges LLM et l'observabilité en production complètent désormais la pile d'évaluation complète.
2026-08-03
Benchmark
Les modèles de vision IA de pointe échouent dans la perception de base, selon un nouveau benchmark
PerceptionBench teste dix capacités visuelles atomiques sur 3 000 questions. Aucun modèle de pointe n'a dépassé 60 %, et des scores globaux similaires masquent des profils de faiblesse radicalement différents.
2026-08-03
Analyse de benchmark
LiveBench refuse de rester figé. C'est tout l'intérêt
LiveBench remplace un corrigé fixe par un pool continuellement actualisé de problèmes de codage, de dépôts et de questions de prédiction, contournant la contamination qui a miné MMLU et GSM8K. Cela fait partie d'un virage plus large vers l'évaluation dynamique, aux côtés de LiveCodeBench, ForecastBench et LLMEval-Fair.
2026-08-03
Test de modèle
Qwen2.5-Omni : le modèle open-source qui tient enfin ce que ses concurrents promettent seulement
Analyse approfondie du modèle open-source qui traite simultanément texte, images, audio et vidéo tout en générant un flux de parole, surpassant GPT-4o-mini et Gemini sur plusieurs benchmarks, tout en tenant sur un seul GPU grand public avec quantification.
2026-08-03
Analyse de benchmark
5 millions de votes, 25 points Elo : Dans les coulisses du classement Chatbot Arena que personne ne peut ébranler
LMSYS Chatbot Arena classe les modèles selon les préférences humaines en aveugle sur une échelle Elo, avec près de cinq millions de votes qui resserrent désormais les meilleurs laboratoires dans une bande de 25 points. Les méthodes LLM-en-tant-que-Juge qui permettent de passer à l'échelle cette évaluation comportent leurs propres biais documentés en faveur de la verbosité et de la position.
2026-08-02