Coût vs. capacité
Le modèle à $1.40 qui a écrasé son homologue à $2.82 en physique
Quatre modèles d'IA ont été invités à construire des scènes HTML avec une physique réaliste. Opus 5 a réussi les trois au coût le plus bas parmi les meilleurs performeurs, tandis que Fable 5 a échoué à chacune au double du prix.
Emmanuel Fabrice Omgbwa Yasse Assisté par IA
2026-07-25 · 3 min de lecture

Atomic.chat, une plateforme connue pour ses benchmarks pratiques en IA, a publié un test ciblé jeudi. La mission : coder trois fichiers HTML simulant la physique de la destruction, une tornade soulevant des objets, un boulet de démolition frappant un bâtiment, et un camion brisant un pont en treillis. Assez simple pour tout modèle qui prétend comprendre comment les choses se déplacent dans l'espace.
Les quatre concurrents : Opus 5 (Anthropic), Fable 5 (Anthropic), Kimi K3 (Moonshot AI) et GPT 5.6 (OpenAI). Opus 5 a utilisé 55,9K tokens et a coûté 1,40 $. Fable 5 a utilisé 55,1K tokens mais a coûté 2,82 $, soit presque le double. Kimi K3 a utilisé 35,7K tokens pour 0,55 $. GPT 5.6 a utilisé 20,1K tokens pour 0,31 $. Moins cher n'est pas toujours meilleur, mais la performance d'Opus 5 à ce prix est difficile à ignorer, surtout étant donné son avantage de coût connu sur d'autres benchmarks.
Ce qu'Opus 5 a bien fait
Opus 5 a livré trois scènes fonctionnelles. Sa tornade faisait tourbillonner des maisons dans l'entonnoir et les projetait par le haut, le genre de comportement qu'une véritable simulation physique devrait montrer. La scène du boulet de démolition affichait le mur se fissurant à l'impact et les débris s'accumulant au sol. Le pont s'est effondré par étapes, précipitant le camion dans la rivière en contrebas. Atomic.chat lui a donné une réussite sur les trois. C'est le genre de performance attendue d'un modèle qui, comme des modèles bien plus petits l'ont montré, n'a pas besoin d'être le plus grand pour être le meilleur.
Où Fable 5 a trébuché
Les scènes de Fable 5 manquaient de cohérence physique de base. Sa tornade n'avait presque rien au sol à soulever, ce qui enlève tout intérêt. Le bâtiment s'est effondré tout seul avant que le boulet de démolition ne l'atteigne. Le pont s'est désintégré d'un coup, sans défaillance progressive, sans état intermédiaire. Pour un modèle commercialisé pour l'ingénierie et le codage, ce sont des échecs embarrassants.
GPT 5.6 et Kimi K3 à la traîne
GPT 5.6 était le moins cher à 31 cents, mais son boulet de démolition n'a jamais atteint le bâtiment, et son pont s'est brisé d'une manière que rien ne se brise dans la vie réelle. Kimi K3, un nouvel entrant de Chine, a obtenu des résultats similaires. Malgré la popularité croissante de Kimi K3, il n'a pas pu égaler Opus 5 en raisonnement physique.
Pourquoi c'est important
Le test est limité mais révélateur. De nombreuses applications d'IA dans les jeux vidéo, la robotique et l'éducation ont besoin de modèles qui raisonnent sur le comportement des objets dans l'espace. C'est un point faible connu de la plupart des grands modèles de langage, qui sont principalement entraînés sur du texte. Les LLM peuvent décrire des données mais peinent à raisonner dessus, et ce benchmark souligne cet écart. Le fait qu'Opus 5 s'en soit bien sorti alors que Fable 5 a échoué suggère que les choix architecturaux ou les données d'entraînement peuvent faire une grande différence.
Le coût apparaît également comme une surprise inattendue. Opus 5 a surpassé son homologue plus cher d'une large marge. Les développeurs à la recherche d'un modèle de simulation auraient intérêt à tester différents modèles de la même famille plutôt que de supposer que le plus cher est meilleur, une leçon qui s'applique au-delà de ce benchmark, comme le révèle souvent le déploiement réel.
Le test confirme ce que les chercheurs avaient déjà noté : les modèles de langage excellent en syntaxe mais peinent souvent avec la sémantique du monde physique. L'ampleur de l'écart entre Opus 5 et Fable 5, tous deux du même laboratoire, rappelle que la spécialisation a ses compromis. Si vous construisez un robot qui doit comprendre les collisions, vous voudrez peut-être voir comment la pile de simulations évolue avant de choisir votre modèle.
L'essentiel de la tech en 3 minutes chaque matin
Un email, chaque jour ouvré, avec ce qui compte vraiment en IA et en tech.