Estrategia de plataforma
Groq dejó de vender velocidad y empezó a vender un sistema operativo para agentes
El lanzamiento del soporte remoto de MCP por parte de Groq el 23 de septiembre, junto con la rápida incorporación de modelos como Kimi K2-0905 y la serie GPT-OSS de OpenAI, transforma su API de un conducto de inferencia rápida a una capa completa de orquestación de agentes. La plataforma ya no compite únicamente por tokens por segundo.
Emmanuel Fabrice Omgbwa Yasse Asistido por IA
2026-07-19 · 4 min de lectura

El registro de cambios cuenta la historia mejor que cualquier comunicado de prensa. Entre el 4 y el 23 de septiembre de 2025, Groq añadió tres capacidades principales: una integración remota del servidor de Protocolo de Contexto de Modelo (MCP) en versión beta, el modelo instructivo Kimi K2-0905 de Moonshot AI y los sistemas agentivos Compound que agrupan búsqueda web, ejecución de código y automatización del navegador en una sola llamada API. Por volumen solo parece una ráfaga de productos. Mire más de cerca y el patrón es coherente: Groq ya no vende inferencia. Vende un sistema operativo agentivo completo para la era de la API.Los agentes paralelos no son cuestión de velocidad. Se…
El lanzamiento de MCP es el más trascendental de los tres. MCP remoto, abreviatura de Protocolo de Contexto de Modelo, el estándar abierto de Anthropic para conectar modelos de IA a herramientas externas, permite a los desarrolladores adjuntar cualquier servidor compatible con MCP a modelos alojados en Groq. La integración es totalmente compatible con la API de Respuestas de OpenAI y su propia especificación remota de MCP. El efecto práctico es que cualquier desarrollador que actualmente use la infraestructura de llamada a herramientas de OpenAI puede migrar a Groq sin tocar una sola línea de código de conector. Cambian el punto final, mantienen las definiciones de herramientas y pagan menos por token. Al anunciar la función, Groq destacó siete socios de lanzamiento: BrowserBase, Browser Use, Exa, Firecrawl, HuggingFace, Parallel, Stripe y Tavily, cada uno de los cuales proporciona un servidor MCP listo para automatización web, búsqueda, raspado o flujos de trabajo de pago.Anthropic Academy: una plataforma gratuita para…
Si MCP es el adaptador universal, el lanzamiento de Kimi K2-0905 ofrece a los desarrolladores un modelo diseñado para explotarlo. La variante más reciente de Moonshot AI llega a GroqCloud con soporte desde el día cero, una ventana de contexto de 256K, la más grande de la plataforma hasta la fecha, y almacenamiento en caché de indicaciones que reduce los costos hasta en un 50% en prefijos almacenados en caché. Los números de rendimiento del modelo son competitivos: más de 200 tokens por segundo a un precio combinado de $1.50 por millón de tokens. Más importante aún, Groq lo posiciona como un modelo de codificación agentivo, afirmando una mayor confiabilidad en interacciones complejas de múltiples turnos. Eso encaja precisamente con la historia de MCP: un modelo que puede manejar múltiples llamadas a herramientas a través de una larga ventana de contexto es exactamente el tipo de motor que hace útil a MCP remoto.Kimi K2.7 Code es más rápido y barato. Pero la…
Los sistemas Compound y Compound Mini, promovidos de beta a disponibilidad general el 4 de septiembre, abstraen por completo la orquestación de herramientas. Construidos sobre GPT-OSS-120B de OpenAI y los modelos Llama de Meta, integran búsqueda web, ejecución de código, Wolfram Alpha y automatización paralela del navegador, hasta diez navegadores simultáneos, en una sola llamada API. Groq afirma una precisión aproximadamente un 25% mayor y un 50% menos de errores en comparación con Web Search Preview de OpenAI y Perplexity Sonar en evaluaciones comparativas internas. Compound no es un modelo; es un agente llave en mano. Los desarrolladores que no quieran ensamblar su propia cadena de herramientas usando MCP simplemente pueden llamar a groq/compound y obtener un asistente de investigación que busca, calcula y navega páginas automáticamente.El arnés de agente CUGA de código abierto de IBM se…
El repertorio de modelos continúa profundizándose. GPT-OSS-20B y GPT-OSS-120B de código abierto de OpenAI, lanzados a principios de agosto, aportan capacidades de razonamiento, búsqueda incorporada en el navegador y salidas estructuradas. Qwen 3 32B, añadido en junio, admite un modo de pensamiento que se puede desactivar para obtener respuestas de baja latencia. Los modelos Llama 4 Scout y Maverick de Meta llegaron en abril con comprensión visual. Groq es deliberadamente agnóstico en cuanto a modelos. La jugada no es apostar por un modelo base, sino alojarlos todos y proporcionar el pegamento que los haga útiles.
El almacenamiento en caché de indicaciones, implementado a finales de agosto, automatiza la optimización de costos. El sistema reutiliza el cálculo de solicitudes recientes que comparten un prefijo común, indicaciones del sistema, definiciones de herramientas, ejemplos de pocas tomas, y aplica un descuento del 50% en los tokens almacenados en caché. Los datos almacenados en caché residen en memoria volátil y caducan en cuestión de horas, lo que evita las preocupaciones de privacidad que persiguen a las cachés persistentes. La función actualmente funciona con Kimi K2, y se prometen otros modelos pronto.
El panorama estratégico es más claro con cada entrada en el registro de cambios. El mercado de la inferencia como servicio se ha convertido en una carrera de productos básicos donde los proveedores compiten por precio por token y repertorio de modelos. Groq está tratando de salir de esa carrera convirtiéndose en la capa de orquestación. MCP remoto ofrece a los desarrolladores una forma estandarizada de adjuntar herramientas. Compound les ofrece un agente preensamblado. Kimi K2 y GPT-OSS les ofrecen modelos con suficiente contexto y soporte de herramientas para usar estas capacidades a escala. Los precios siguen siendo competitivos, $1.50 por millón de tokens para Kimi K2, $0.29/$0.59 para Qwen 3, pero la diferenciación ya no se trata de la economía unitaria de una sola llamada de inferencia. Se trata del costo total de construir una aplicación agentiva, de principio a fin.
Hay riesgos. MCP sigue siendo un estándar beta, y la propia hoja de ruta de Anthropic para el protocolo podría cambiar de maneras que compliquen la integración de Groq. Las cifras de rendimiento de Compound provienen de las propias evaluaciones comparativas de Groq, no de auditorías independientes, y la confiabilidad de los agentes en el mundo real tiende a degradarse en casos extremos que las evaluaciones controladas no capturan. El rápido ritmo de incorporación de modelos también plantea la cuestión del mantenimiento. Cada nuevo modelo requiere pruebas de compatibilidad continuas en todas las integraciones de herramientas, lo que no escala linealmente.600 archivos, un comando: lo que la refactorización de…
Aun así, la dirección es clara. Groq está construyendo para un mundo donde la aplicación no es una interfaz de chat sino una red de llamadas a herramientas orquestadas por un modelo de razonamiento. El registro de cambios de los últimos cinco meses documenta la infraestructura para ese mundo: MCP remoto para conectarlo, Compound para empaquetarlo, Kimi K2 para ejecutarlo, almacenamiento en caché de indicaciones para pagar menos por ello. Los tokens por segundo todavía importan, pero ya no son el titular. El titular es que Groq quiere ser la plataforma donde se ensamblen los agentes, no solo donde ocurra la inferencia.Aleph Alpha construye modelo teórico de inferencia para…
- Fuente : Groq Changelog — 2025-04-29
Lo esencial de la tecnología en 3 minutos cada mañana
Un correo, cada día laborable, con lo que realmente importa en IA y tecnología.