Costo vs. capacidad
El modelo de $1.40 que aplastó a su hermano de $2.82 en física
Se pidió a cuatro modelos de IA que construyeran escenas HTML con física real. Opus 5 pasó las tres al menor costo entre los mejores, mientras que Fable 5 falló en cada una al doble del precio.
Emmanuel Fabrice Omgbwa Yasse Asistido por IA
2026-07-25 · 3 min de lectura

Atomic.chat, una plataforma conocida por sus benchmarks prácticos de IA, publicó una prueba enfocada el jueves. La tarea: programar tres archivos HTML que simulen física de destrucción: un tornado levantando objetos, una bola de demolición golpeando un edificio y un camión rompiendo un puente de armadura. Suficientemente simple para cualquier modelo que afirme entender cómo se mueven las cosas en el espacio.
Los cuatro contendientes: Opus 5 (Anthropic), Fable 5 (Anthropic), Kimi K3 (Moonshot AI) y GPT 5.6 (OpenAI). Opus 5 usó 55.9K tokens y costó $1.40. Fable 5 usó 55.1K tokens pero costó $2.82, casi el doble. Kimi K3 usó 35.7K tokens por $0.55. GPT 5.6 usó 20.1K tokens por $0.31. Más barato no siempre es mejor, pero el rendimiento de Opus 5 a ese precio es difícil de ignorar, especialmente dado su conocida ventaja de costo en otros benchmarks.
Lo que Opus 5 hizo bien
Opus 5 entregó tres escenas funcionales. Su tornado tenía casas girando hacia arriba por el embudo y saliendo disparadas por la parte superior, el tipo de comportamiento que debería mostrar una simulación de física real. La escena de la bola de demolición mostró la pared agrietándose al impacto y escombros acumulándose en el suelo. El puente colapsó en etapas, dejando caer el camión al río de abajo. Atomic.chat le dio el visto bueno en las tres. Es el tipo de rendimiento que esperarías de un modelo que, como modelos mucho más pequeños han demostrado, no necesita ser el más grande para ser el mejor.
Donde Fable 5 tropezó
Las escenas de Fable 5 carecían de coherencia física básica. Su tornado casi no tenía nada en el suelo que recoger, lo que anula el propósito. El edificio colapsó por sí solo antes de que la bola de demolición lo alcanzara. El puente se desintegró de una vez, sin fallo progresivo, sin estado intermedio. Para un modelo comercializado para ingeniería y programación, estos son fracasos embarazosos.
GPT 5.6 y Kimi K3 se quedan atrás
GPT 5.6 fue el más barato con 31 centavos, pero su bola de demolición nunca alcanzó el edificio, y su puente se rompió de una manera que nada se rompe en la vida real. Kimi K3, un participante más nuevo de China, terminó con resultados similares. A pesar de la creciente popularidad de Kimi K3, no pudo igualar a Opus 5 en razonamiento físico.
Por qué es importante
La prueba es limitada pero reveladora. Muchas aplicaciones de IA en juegos, robótica y educación necesitan modelos que razonen sobre cómo se comportan los objetos en el espacio. Este es un punto débil conocido de la mayoría de los grandes modelos de lenguaje, que están entrenados principalmente en texto. Los LLM pueden describir datos pero les cuesta razonar a través de ellos, y este benchmark subraya la brecha. Que Opus 5 lo manejara bien mientras que Fable 5 no, sugiere que las elecciones arquitectónicas o los datos de entrenamiento pueden marcar una gran diferencia.
El costo también surge como un giro inesperado. Opus 5 superó a su hermano más caro por un amplio margen. Los desarrolladores que buscan un modelo de simulación harían bien en probar en toda la familia en lugar de asumir que lo más caro es mejor, una lección que se aplica más allá de este benchmark, como a menudo revela el despliegue en el mundo real.
La prueba confirma algo que los investigadores han notado antes: los modelos de lenguaje sobresalen en sintaxis pero a menudo luchan con la semántica del mundo físico. El tamaño de la brecha entre Opus 5 y Fable 5, ambos del mismo laboratorio, es un recordatorio de que la especialización conlleva compensaciones. Si estás construyendo un robot que necesita entender colisiones, quizás quieras ver cómo está evolucionando la pila de simulación antes de elegir tu modelo.
Lo esencial de la tecnología en 3 minutos cada mañana
Un correo, cada día laborable, con lo que realmente importa en IA y tecnología.