Features
In-depth special reports combining feature, analysis, interview and profile reporting.
31 published features
Modèles vidéo de pointe : rapport spécial
Perceptron Mk1 parie que l'avenir de l'IA vidéo réside dans l'observation, pas dans la génération
Perceptron Mk1 est un modèle vision-langage propriétaire, tarifé pour une utilisation en continu, conçu pour la compréhension vidéo horodatée et le raisonnement incarné. La véritable course de l'IA vidéo ne consiste pas à produire des clips plus esthétiques, et les benchmarks qui mélangent les deux catégories induisent en erreur.
2026-08-06
Sécurité de l’IA
Shieldstral, le classifieur 3B qui surclasse des modèles sept fois plus grands
Un classifieur de sécurité 3B égale des modèles de texte presque sept fois plus gros et établit un nouvel état de l'art en modération multimodale, selon un article arXiv de juillet 2026. L'astuce : une modération reformulée en question-réponse binaire, entraînée sur environ 54,1 millions d'échantillons.
2026-08-05
Évaluation IA
Les anciens benchmarks IA ont cassé. Voici ce qui les a remplacés.
Les benchmarks statiques comme MMLU et GSM8K sont saturés et contaminés. L'industrie s'est tournée vers la régénération dynamique, les examens de niveau expert et les environnements de tâches agentiques pour obtenir une véritable mesure de la capacité de l'IA.
2026-08-04
Agents IA
Traiter les SOP comme du code : un nouveau runtime à pagination par pile sépare les agents forts des faibles
De nouvelles recherches de Hong Kong et de Chine continentale démontrent que la compilation des SOP en pseudo-code exécutable et leur exécution sur une machine virtuelle à pagination par pile séparent clairement les agents capables des agents fragiles. Le travail donne une règle de déploiement précise : compiler d'abord, paginer seulement après une vérification de discipline au niveau du modèle.
2026-08-04
Rapport spécial : Évaluation de l'IA
L'état du benchmarking IA en 2026 : l'effondrement des tests statiques et les systèmes conçus pour les remplacer
Un tour d'horizon complet du paysage du benchmarking IA en 2026 : pourquoi MMLU, GSM8K et HumanEval ont cassé, comment les benchmarks dynamiques et les examens d'experts comme HLE et GPQA Diamond les ont remplacés, ce que révèlent les tests agentiques et d'intelligence irrégulière, et comment les préférences humaines, les juges LLM et l'observabilité en production complètent désormais la pile d'évaluation complète.
2026-08-03
Intelligence Artificielle
Comment un système à double mémoire a appris à l'IA à diagnostiquer les pannes qu'elle oublie sans cesse
OpsMem couple une mémoire à court terme (MCT) pour l'état de diagnostic en évolution avec une mémoire à long terme (MLT) pour l'expérience opérationnelle réutilisable. Grâce à un mécanisme appelé résonance inter-mémoire, le système active l'expérience pertinente à l'état à partir de la MLT pour guider le diagnostic multi-agents. Sur un ensemble de données de microservices de Huawei, il a surpassé les références basées sur le raisonnement agentique et la connaissance augmentée avec des marges significatives.
2026-08-03
Interprétabilité de l'IA
Les décisions de votre réseau neuronal peuvent désormais être retracées jusqu'à des cas d'entraînement spécifiques
Des chercheurs montrent que les scores d'action des réseaux neuronaux peuvent être exprimés comme des sommes pondérées exactes de retours de cas d'entraînement, en utilisant la géométrie de Gram. Cela permet d'obtenir des signaux d'audit post-entraînement qui identifient les cas influents, mesurent la cohérence des actions et signalent un faible soutien, sans réentraînement ni accès à la trajectoire d'optimisation d'origine.
2026-08-03
Recherche IA
Pourquoi la log-probabilité des tokens est le mauvais indicateur pour surveiller les modèles de raisonnement IA
Novelis Research montre que la log-probabilité des tokens échoue en tant que moniteur de décodeur pour les modèles de raisonnement quantifiés, étant aveugle aux boucles confiantes. Ils introduisent un contrôleur e-CUSUM calibré qui combine l'incertitude et les signaux de répétition, atteignant une sélectivité sur GSM8K avec DeepSeek-R1-Distill-Qwen-1.5B.
2026-08-03
Recherche en IA
L'écume dans le raisonnement en chaîne : un nouveau benchmark révèle pourquoi les LLM gaspillent des tokens sur des raisonnements valides mais inutiles
Les LLM génèrent souvent des chaînes de raisonnement correctes mais alourdies par des étapes inutiles. Un nouveau benchmark diagnostique et une méthode de compression montrent que les évaluateurs actuels ignorent totalement cette inefficacité et que la moitié des étapes de raisonnement rédigées par des humains pourraient être compressibles.
2026-07-31
Mathématiques formelles
Comment un laboratoire chinois a surmonté le goulot d'étranglement de la preuve mathématique assistée par IA
Le cadre ToMap de l'Université de Nanjing atteint des résultats de pointe en auto-formalisation complète de preuves en identifiant l'étape de décomposition comme le goulot d'étranglement critique. En utilisant une évolution itérative et guidée par Pareto des décompositions de preuves, ToMap améliore la précision syntaxique et sémantique conjointe de 19 % sur le benchmark ProofFlowBench tout en réduisant les coûts en phase de test.
2026-07-30
Recherche
Six mots qui pourraient remodeler la manière dont les agents d'IA explorent et restent en sécurité : perturber, valider, courtier
Une architecture novatrice de cohorte d'agents hétérogènes sépare l'exploration divergente, le filtrage de sécurité à l'exécution et la récupération de connaissances inter-domaines en rôles spécialisés. Le Perturbateur génère des propositions à haute entropie, le Validateur impose des vérifications strictes des appels d'outils, et le Courtier importe des analogies hors domaine via une récupération de nouveauté contrastive. Les échecs d'exécution sont compilés en correctifs de contrainte signés appelés Scars, mis en cache pour les générations futures. Dans les évaluations, la cohorte a atteint 95% de découverte de cibles distantes, zéro violation exécutée, et 15,1% d'économies de jetons grâce aux Scars, avec une réduction de 55,9% des coûts sous contraintes de ressources via une allocation de bande passante basée sur le crédit.
2026-07-30
Analyse d'entreprise
QwenPaw-Data d'Alibaba veut être la couche manquante entre les analystes métier et leurs données
QwenPaw-Data d'Alibaba introduit une architecture à trois sous-systèmes, DataBridge, Skill-Hub et Host, pour transformer les données d'entreprise fragmentées en actifs analytiques réutilisables. Les évaluations précoces montrent des gains substantiels par rapport aux systèmes existants sur les benchmarks publics et les charges de travail BI industrielles.
2026-07-30