Arquitectura de IA
La carrera de modelos tiene ahora una segunda pista: la orquestación supera al tamaño bruto
El tope de Anthropic a las habilidades cibernéticas de Claude Opus 5, Fugu de Sakana orquestando enjambres de modelos y el nuevo enrutamiento multimodelo de Claude Code apuntan al mismo cambio: la próxima ventaja competitiva en sistemas de IA es la orquestación, no solo el tamaño bruto del modelo.

Anthropic limitó deliberadamente las capacidades de ciberseguridad de Claude Opus 5. Sakana AI construyó Fugu para orquestar un conjunto de modelos abiertos en lugar de entrenar uno gigante. Y Claude Code, la propia herramienta de codificación de Anthropic, acaba de obtener la capacidad de enrutar una tarea a través de un grupo completo de modelos en lugar de enviarlo todo a un solo modelo insignia. Ninguno de estos es el mismo producto, y ninguno de los equipos detrás de ellos coordinó. Pero puestos uno al lado del otro, describen la misma apuesta: las próximas ganancias en sistemas de IA provienen menos de hacer un modelo más grande y más de decidir, por tarea, qué modelo o qué parte de un modelo debería estar involucrado.
El enjambre hace explícito el cálculo
La comparación entre Claude Opus 5 y Fugu de Sakana expone claramente la compensación. Opus 5 ofrece un rendimiento cercano al insignia a aproximadamente la mitad del costo de tokens de las alternativas de primer nivel, un buen acuerdo para la mayoría de las cargas de trabajo. Pero sus habilidades de ciberseguridad están deliberadamente limitadas, y en tareas que necesitan esa capacidad, el enfoque de Fugu de orquestar múltiples modelos abiertos más pequeños alcanza o supera los puntos de referencia de frontera al distribuir el trabajo entre especialistas en lugar de pedir a un generalista que lo haga todo. Cuál gana depende de la tarea, el presupuesto y cuánta complejidad de orquestación un equipo está dispuesto a asumir. Esa es una decisión de compra genuinamente nueva: no "qué modelo es el más inteligente", sino "qué estrategia de enrutamiento se adapta a este trabajo".
La nueva integración de Claude Code con Fugu toma esa lógica y la coloca dentro de una herramienta que millones de desarrolladores ya usan a diario. Los desarrolladores ahora pueden incorporar un conjunto de modelos especializados en el propio entorno de codificación de Anthropic, en lugar de estar limitados a lo que sea que Claude esté ejecutando esa semana. El detalle que vale la pena considerar es quién lanzó esto: no una startup tratando de diferenciarse, sino la empresa que fabrica el modelo insignia, construyendo una puerta para que los modelos de la competencia entren en su propio producto. Eso es una señal de hacia dónde cree la empresa que se dirige el mercado. El enrutamiento de modelos dejó de ser un truco que los desarrolladores construían para sí mismos y se convirtió en una característica de plataforma que un laboratorio de frontera envía por defecto.
La misma lógica, una capa más abajo
El patrón no se limita al enrutamiento entre modelos completos. El enfoque de CLSA hacia la atención dispersa aplica la misma idea dentro del paso de inferencia de un solo modelo: en lugar de calcular una decisión de enrutamiento nueva en cada capa, derrochador y repetitivo, calcula un pase de enrutamiento por secuencia y lo reutiliza, reduciendo la sobrecarga de KV-cache mientras preserva la selectividad a nivel de token. La ganancia reportada, de hasta 17.1x de rendimiento en contexto de 128K, proviene de reconocer que un recálculo completo en cada capa estaba resolviendo un problema que una única decisión bien colocada podía manejar igual de bien.
Ese es el hilo conductor de las tres historias. Ya sea la pregunta de qué modelo maneja una tarea completa, qué sistema especializado maneja un escaneo de seguridad, o qué cabezas de atención se calculan en una capa determinada, la industria está convergiendo en la misma respuesta: no ejecutes todo a través del mismo camino costoso por defecto. Decide una vez, enruta en consecuencia, y solo paga el costo total donde realmente te compra algo. Escalar un solo modelo todavía está ocurriendo, pero ya no es la única palanca que alguien está usando, y cada vez menos la primera.
Lo que esto significa para los compradores
La conclusión práctica para cualquiera que despliegue estos sistemas es que "qué modelo deberíamos usar" se está convirtiendo en la pregunta equivocada para hacer de forma aislada. La mejor pregunta es qué combinación, y si la sobrecarga de orquestación vale la pena para una carga de trabajo determinada. El enfoque multiagente de Fugu añade complejidad real, más partes móviles, más lugares donde un pipeline puede fallar, más superficie para monitorear. La simplicidad de Opus 5 es una característica, no una limitación, para equipos que no necesitan el techo especializado que Fugu puede alcanzar. No hay un ganador universal aquí, y ese es precisamente el punto: las decisiones de enrutamiento son inherentemente locales a la tarea, lo cual es un mundo muy diferente de aquel donde todos simplemente esperaban el próximo lanzamiento insignia.
Lo esencial de la tecnología en 3 minutos cada mañana
Un correo, cada día laborable, con lo que realmente importa en IA y tecnología.