Benchmarks
20 published articles
Le cheval de trait de Google, plus étoffé dans la mise à jour 3.7
Gemini 3.7 Flash divise son prix par deux, puis le justifie
Le Gemini 3.7 Flash de Google sort à la moitié du prix de lancement du 3.6 Flash, tout en revendiquant des gains sur les benchmarks de codage, de développement web et de travail cognitif. La sortie intervient trois semaines après le Flash précédent et s'accompagne d'un nouvel argument prix-performance pour les développeurs d'agents.
2026-08-16
Intelligence artificielle
Grok 4.6 fait match nul avec GPT-5.6 Sol à 61, puis les scores par composante divergent
Le Grok 4.6 de xAI fait match nul avec GPT-5.6 Sol à 61 sur l'indice Artificial Analysis Intelligence, un composite de neuf benchmarks. La répartition est déséquilibrée : victoires sur le travail de connaissance et la plupart des tests de code, défaites sur DeepSWE et Terminal-Bench. Disponible dès maintenant dans Cursor et Grok Build, à partir de 2 $ par million de jetons d'entrée.
2026-08-13
Agents IA embarqués
LFM2.5-2.6B : le petit agent qui distance des modèles 4 fois plus gros
Le LFM2.5-2.6B de Liquid AI fait tenir un modèle agentique dans 2,6 milliards de paramètres et moins de 2,5 Go de mémoire, et domine tous les benchmarks de suivi d'instructions sur lesquels il a été testé. Il tourne à 220 tokens/s sur un ordinateur portable ; le code est la seule lacune claire.
2026-08-12
IA frontière
Le Claude le plus intelligent d'Anthropic est celui que vous ne pouvez pas utiliser
Anthropic a lancé Claude Fable 5 pour tous et réservé Claude Mythos 5 à des partenaires vérifiés. Même classe de modèles, deux portes d'accès. Les benchmarks comptent moins que le routage, et le routage est la manière dont l'IA frontière se déploie désormais.
2026-08-03
Messier Corpus
957 253 enregistrements ne peuvent cacher l'écart : les agents IA explosent en codage mais stagnent là où les entreprises en ont besoin
Le corpus Messier, avec 957 253 enregistrements sur 30 benchmarks, révèle des progrès inégaux des agents IA : l'appel de fonctions est saturé, la programmation s'améliore le plus vite, et les workflows d'entreprise sont à la traîne. Il montre aussi que l'agrégation stricte tout-ou-rien peut masquer les gains et inverser les classements.
2026-08-02
Open Source
OpenForgeRL entraîne des agents IA sans toucher à leurs infrastructures d'inférence
OpenForgeRL utilise un proxy et Kubernetes pour entraîner des agents IA sans modifier leurs infrastructures d'inférence. Lors des tests, OpenForgeGUI a égalé des modèles plusieurs fois plus grands sur des benchmarks de navigation web et de bureau.
2026-08-01
Agents GUI
L'agent Qwen-UI-Agent d'Alibaba obtient de meilleurs scores sur de vrais téléphones que dans les sandboxes
Le Qwen-UI-Agent du laboratoire Tongyi d'Alibaba revendique des scores mobiles de pointe (97,5 % sur AndroidDaily) et des résultats compétitifs en usage informatique face à Opus 4.8, Gemini 3.1 Pro et GPT-5.6 Sol. Son score sur benchmark sur appareil réel dépasse son score en sandbox, tandis que 40 % de progression partielle sur OSWorld-v2 constitue la limite honnête.
2026-07-31
Ingénierie multi-agents
L'expérience multi-agents de Qoder : 60 % d'erreurs en moins, mais à quel prix ?
Une analyse d'Experts Mode de Qoder d'Alibaba Cloud, qui déploie des agents IA spécialisés comme une équipe coordonnée. Les affirmations de réduction significative des erreurs sont examinées à la lumière de cas d'usage réels et des compromis de la complexité multi-agent.
2026-07-31
Modèles d'IA
La conception à quatre spécialistes de 748B du Macaron-V1-Venti bat GPT-5.5 et Opus 4.8
Macaron-V1-Venti de MindLab Research mène les benchmarks en intelligence personnelle, codage, utilisation du terminal et UI générative, utilisant une nouvelle architecture Mixture of LoRA qui maintient le modèle compact tout en étant spécialisé.
2026-07-27
Recherche en IA
Kling publie deux benchmarks qui révèlent à quel point la vidéo générative est en réalité médiocre
KlingTeam présente MultiRef-Compass et KeyFrame-Compass, deux benchmarks qui poussent les modèles de génération vidéo au-delà du texte vers la vidéo et vers des tâches multi-références et conditionnées par images clés. Les premiers tests sur respectivement huit et neuf systèmes montrent des échecs systématiques dans la liaison des entités, la préservation de l’ordre temporel et la gestion de contraintes denses.
2026-07-26
Cyberdéfense
Le Fugu-Cyber de Sakana AI atteint 86,9 % sur les benchmarks de sécurité, mais prévient que les modèles bruts ne sont pas la solution
Sakana AI a publié Fugu-Cyber, un modèle d'orchestration multi-agents égalant les modèles de cybersécurité de pointe sur les benchmarks. L'entreprise soutient que l'accès brut aux modèles ne peut pas remplacer l'expertise humaine et les flux de vérification pour sécuriser les entreprises.
2026-07-21
Fondements de l’IA
Pourquoi l’IA ne peut toujours pas s’expliquer : un cadre pour penser la rigueur
Un article de Google DeepMind présente un cadre en trois parties pour penser la rigueur dans l’IA : conceptuelle, épistémique et opérationnelle. Il soutient que les progrès rapides de l’apprentissage profond sont venus de la priorisation de l’itération axée sur la performance par rapport à la compréhension scientifique, et que combler les lacunes nécessitera plus que de meilleurs benchmarks.
2026-07-20