Inteligencia Artificial
Grok 4.6 empata con GPT-5.6 Sol en 61, pero las puntuaciones por componente se dividen
El Grok 4.6 de xAI empata con GPT-5.6 Sol en 61 en el Artificial Analysis Intelligence Index, un compuesto de nueve benchmarks. El desglose es desigual: victorias en trabajo de conocimiento y en la mayoría de las pruebas de código, pérdidas en DeepSWE y Terminal-Bench. Disponible ahora en Cursor y Grok Build, desde $2 por millón de tokens de entrada.
Emmanuel Fabrice Omgbwa Yasse Asistido por IA
2026-08-13 · 4 min de lectura

El nuevo lanzamiento de xAI defiende que los modelos frontera deberían evaluarse por cuánto tiempo pueden sostener una tarea, no por lo rápido que responden a un solo prompt. Grok 4.6, disponible hoy, está diseñado para trabajos que se extienden a lo largo de muchos pasos: investigar un tema, analizar información, trabajar sobre una base de código, llevar una idea hasta una aplicación funcional. xAI dice que el modelo se mantiene en tareas complejas a lo largo de esas trayectorias y, en ejecuciones más largas, empieza a verificar su propio trabajo antes de continuar.
La cifra principal es un 61 en el Artificial Analysis Intelligence Index, un compuesto de nueve benchmarks. Eso sitúa a Grok 4.6 al mismo nivel que GPT-5.6 Sol y a un punto de Fable 5, que obtiene 62. Comparado con el lanzamiento anterior de la propia xAI, el avance es inequívoco: Grok 4.5 obtuvo 56 en el mismo índice.
El compuesto es donde reside el empate. Las puntuaciones por componente que publicó xAI cuentan una historia más dividida. Grok 4.6 supera a GPT-5.6 Sol en seis de los benchmarks listados: GDPVal-AA v2 (1753 frente a 1728), CursorBench v3.2 (69.9% frente a 67.2%), FrontierCode v1.1 en su forma extendida (61.3% frente a 60.6%), APEX-Agents (57.5% frente a 56.7%), AA-Briefcase (1577 frente a 1502) y la evaluación Harvey LAB (Vals), donde registra un 15.8% frente al 2.5% de su rival. En APEX-SWE, xAI reporta un 56.4% y GPT-5.6 Sol no tiene puntuación publicada. Las pérdidas se concentran en dos filas: DeepSWE v1.1 con 65.9% frente al 73%, y Terminal-Bench v3.0 con 26% frente al 34.6%.
Esos dos déficits son los que importan para un lanzamiento orientado a agentes de larga duración. Ambos benchmarks recompensan la ejecución sostenida durante una sesión larga, precisamente el territorio que se supone que el modelo debe dominar. La trayectoria es alentadora: DeepSWE sube del 54% en Grok 4.5 al 65.9%, Terminal-Bench del 15.7% al 26%, y APEX-Agents del 47.1% al 57.5%, los tres mayores aumentos en puntos porcentuales de la tarjeta de resultados de xAI. Pero GPT-5.6 Sol todavía mantiene una ventaja de siete a nueve puntos en las dos pruebas de ejecución, y Fable 5 va de cuatro a ocho puntos por delante.
La tarjeta de resultados que publicó xAI
| Benchmark | Grok 4.6 | Grok 4.5 | GPT-5.6 Sol | Fable 5 |
|---|---|---|---|---|
| AA Intelligence Index | 61 | 56 | 61 | 62 |
| GDPVal-AA v2 | 1753 | 1526 | 1728 | 1741 |
| CursorBench v3.2 | 69.9% | 66.7% | 67.2% | 70.5% |
| DeepSWE v1.1 | 65.9% | 54% | 73% | 70% |
| FrontierCode v1.1 (Extended) | 61.3% | 56.6% | 60.6% | 63.6% |
| APEX-Agents | 57.5% | 47.1% | 56.7% | 59.2% |
| Terminal-Bench v3.0 | 26% | 15.7% | 34.6% | 34.1% |
| APEX-SWE | 56.4% | 53.6% | n/a | 58.8% |
| AA-Briefcase | 1577 | 1313 | 1502 | 1574 |
| Harvey LAB (Vals) | 15.8% | 12.9% | 2.5% | 11.3% |
La mejor puntuación de cada fila está en negrita. Las cifras de los competidores provienen de las system cards publicadas por cada desarrollador o de los leaderboards de benchmarks, según el comunicado de xAI.
Cómo se entrenó Grok 4.6: el bucle autoconstruido continúa
La historia del entrenamiento extiende el patrón que xAI estableció con Grok 4.5, cuyos entornos de entrenamiento fueron construidos por agentes autónomos en lugar de ingenieros humanos, un detalle que Cursor, que entrenó a 4.5 junto con xAI, reveló en su momento. Para 4.6, xAI describe una ejecución de entrenamiento suplementario más larga que la de 4.5, alimentada con datos generados por el modelo y curados para razonamiento y conceptos técnicos avanzados, datos de ingeniería de alta calidad, y un optimizador y una receta mejorados. Grok 4.5 generó entonces las trayectorias SFT en tareas de razonamiento, harnesses de agentes, STEM, ingeniería de software y trabajo de conocimiento, con verificaciones basadas en modelos que filtraban las trazas malas. La etapa de RL que siguió cubrió tareas agénticas, incluida la codificación general y entornos específicos de dominio para optimización de kernels, desarrollo web y diseño asistido por computadora.
Los resultados a nivel de modelo coinciden con la propuesta. xAI dice que Grok 4.6 es especialmente fuerte a la hora de convertir una idea de producto amplia en una primera versión funcional, investigar dominios desconocidos, estructurar una aplicación, implementar interacciones centrales y refinar a través de varias rondas de retroalimentación. También reporta primeros borradores más sólidos en trabajo visual e interactivo de lo que Grok 4.5 solía producir, con la estructura y el lenguaje visual de un proyecto establecidos en una sola pasada.
Dónde se ejecuta y cuánto cuesta
Grok 4.6 está disponible hoy en Grok Build y Cursor, a través de la API de xAI, y mediante socios como OpenRouter, Vercel y Cloudflare. Los precios comienzan en $2 por millón de tokens de entrada y $6 por millón de tokens de salida, con una variante rápida al doble del precio. Para que el modelo llegue rápidamente a las manos de los usuarios, xAI está duplicando el uso incluido en Grok Build y Cursor durante la primera semana.
En cuanto a seguridad, xAI dice que las salvaguardas se calibraron junto con las capacidades ampliadas del modelo, respaldadas por su suite más amplia hasta la fecha de pruebas previas al despliegue, además de pruebas posteriores al despliegue y de terceros. El lanzamiento mantiene explícitamente dentro del alcance el trabajo legítimo como el parcheo de vulnerabilidades y la aceleración de los ciclos de diseño de ingeniería.
El empate compuesto con GPT-5.6 Sol es real, y la tarjeta de resultados subyacente es más estrecha de lo que sugiere el encuadre. Grok 4.6 gana en el trabajo al que xAI lo apuntó, investigación densa en conocimiento y builds interactivos, y queda rezagado en las tareas de ejecución más largas. Las brechas en DeepSWE y Terminal-Bench quedan de siete a nueve puntos por detrás de GPT-5.6 Sol. Lo bastante pequeñas para cerrarse en un lanzamiento menor. Lo bastante grandes para importar exactamente para las cargas de trabajo para las que se vende este modelo.
- Fuente : xAI: Grok 4.6 release announcement
Lo esencial de la tecnología en 3 minutos cada mañana
Un correo, cada día laborable, con lo que realmente importa en IA y tecnología.