Agentes de voz
Por qué Grok 4.1 Fast supera a modelos más inteligentes en una llamada telefónica
Las clasificaciones generales eligen los LLM equivocados para las llamadas de voz. La clasificación de 2026 de BenchLM pone la latencia primero: Grok 4.1 Fast responde en 0.54s, mientras que Claude Opus 4.6, el mejor puntuado, necesita 1.78s. Los modelos rápidos se llevan la conversación; los modelos de razonamiento se quedan en las llamadas a herramientas en segundo plano.
Emmanuel Fabrice Omgbwa Yasse Asistido por IA
2026-08-05 · 5 min de lectura

Las tablas de benchmarks y las llamadas telefónicas castigan cualidades distintas. El modelo que encabeza una clasificación general suele ser el último que quieres al oído de quien llama, porque la métrica que decide si una conversación sobrevive es el tiempo hasta la primera respuesta, y ese es el número que la mayoría de las clasificaciones entierran u omiten.
El informe de agentes de voz 2026 de BenchLM ilustra el punto con datos de ejecución en vivo. Su panel de velocidad muestra a Claude Opus 4.6, el mayor puntuador general con 86, tardando 1.78 segundos en producir una primera respuesta. Grok 4.1 Fast, con 68, responde en 0.54 segundos. En una llamada en vivo, uno de estos modelos funciona y el otro se percibe como una llamada caída.
Por qué las clasificaciones fallan en una llamada
Aproximadamente el 70% del retraso que siente un interlocutor proviene de la inferencia del LLM, lo que convierte la elección del modelo en la mayor palanca de latencia que tiene un desarrollador. Una respuesta que comienza en menos de 800 milisegundos se siente natural. Alrededor de 1.5 segundos se siente lenta. Pasados tres segundos, los interlocutores asumen que la línea está muerta y empiezan a hablar por encima del agente.
Esa restricción descalifica silenciosamente a la mayoría de los modelos de razonamiento. Su fase de pensamiento sitúa la latencia de la primera respuesta entre 10 y 150 segundos en el panel de BenchLM, y ninguna puntuación de benchmark sobrevive a una pausa de 30 segundos en una llamada telefónica. El límite práctico ronda los 1.5 segundos: cualquier cosa más lenta es un trabajador de segundo plano, no un conversador.
Los modelos más rápidos que superan el listón
Estos son los modelos de menor latencia que aún superan un listón de calidad utilizable, según los datos de ejecución en vivo de BenchLM:
| Modelo | Primera respuesta | Velocidad de salida | Tipo | Puntuación general |
|---|---|---|---|---|
| Grok 4.1 Fast | 0.54s | 138 t/s | Sin razonamiento | 68 |
| Claude Opus 4.5 | 1.01s | 46 t/s | Sin razonamiento | 75 |
| GPT-4.1 | 1.02s | 108 t/s | Sin razonamiento | 56 |
| GLM-4.7 | 1.10s | 82 t/s | Razonamiento | 68 |
| Gemini 3 Flash | 1.19s | 159 t/s | Sin razonamiento | 55 |
| Claude Sonnet 4.6 | 1.48s | 44 t/s | Sin razonamiento | 80 |
| GLM-5 | 1.64s | 74 t/s | Sin razonamiento | 66 |
| Claude Opus 4.6 | 1.78s | 40 t/s | Sin razonamiento | 86 |
| MiMo-V2-Flash | 2.14s | 129 t/s | Razonamiento | 59 |
| Kimi K2.5 | 2.38s | 45 t/s | Sin razonamiento | 63 |
El tiempo hasta la primera respuesta se mide de extremo a extremo, incluida la fase de pensamiento completa de los modelos de razonamiento. La velocidad de salida es la mediana de tokens por segundo. Los modelos pequeños de menos de 1B pueden registrar menor latencia, pero quedan por debajo del listón de calidad para cualquier cosa más allá de un IVR simple.
Lo que los datos realmente eligen
Grok 4.1 Fast es el destacado: medio segundo hasta la primera respuesta mientras aún supera una puntuación general de mediados de los 60, la combinación poco común que la voz realmente necesita. Los niveles Gemini Flash ganan en rendimiento bruto, y la velocidad de salida importa una vez que el modelo empieza a hablar porque determina la rapidez con la que el audio puede transmitirse. Gemini 3 Flash registra la tasa más rápida de la tabla con 159 tokens por segundo.
GPT-4.1 equilibra aproximadamente un segundo de latencia con un contexto de 1M de tokens y llamadas a funciones fiables. Claude Sonnet 4.6 es la elección cuando estás dispuesto a cambiar unos cientos de milisegundos por un seguimiento de instrucciones notablemente mejor con una personalidad compleja; su puntuación general de 80 es la mejor de la tabla entre los modelos por debajo del techo de 1.5 segundos. Claude Opus 4.6, el mejor puntuador de la tabla con 86, se sitúa en el lado equivocado de esa línea.
La capacidad sigue importando, pero no como la clasifican los rankings. Un agente de voz vive dentro de un prompt de sistema que define la personalidad, las salvaguardas y los límites de longitud de salida, y los modelos que se desvían de las instrucciones dejan poco a poco de sonar como tu producto y empiezan a leer listas y URL en voz alta. La disciplina de longitud es la versión más aguda de esto: en pantalla, una respuesta demasiado larga es un desplazamiento; en una llamada, son diez segundos de interlocutor esperando para interrumpir.
Observa lo que falta en la tabla: los modelos insignia de razonamiento que encabezan la clasificación general. Ese es el sentido de todo el ejercicio. Los modelos insignia pertenecen al segundo plano, no al oído del interlocutor.
El patrón de cerebro dividido
Los agentes de voz en producción en 2026 rara vez usan un solo modelo. Usan dos: un modelo rápido lleva la conversación, y un modelo de razonamiento se reserva para preguntas realmente difíciles, normalmente detrás de una llamada a herramienta. Los equipos suelen descubrirlo a la mala, después de lanzar un único modelo insignia y ver cómo el abandono de llamadas se dispara en cada turno que activa un pensamiento largo.
Dónde encaja la decisión sobre el modelo
El LLM es uno de los tres componentes, y la plataforma en la que lo integras decide cuánto de esa elección conservas. La API Realtime de OpenAI es un pipeline nativo de voz a voz, la ruta más rápida hacia una demo funcional, pero te ata a los modelos de OpenAI: ni Grok 4.1 Fast, ni un modelo de pesos abiertos autoalojado. Las capas de orquestación como Retell y Vapi te entregan la plomería y te dejan elegir el cerebro. ElevenLabs, a la que el informe llama el estándar de producción en 2026, añade la capa de voz por sí misma, con un tiempo bajo hasta el primer audio que se suma a la latencia de tu LLM, voces estables en sesiones largas y un plan gratuito para prototipar.
Elección por caso de uso
- Agente telefónico orientado al cliente: elige el modelo más rápido que supere tu listón de seguimiento de instrucciones, es decir, Grok 4.1 Fast o un nivel Gemini Flash. Una ventaja de dos puntos en un benchmark es invisible para un interlocutor; una pausa de un segundo no lo es.
- Asistente de voz interno: tolerante a la latencia, por lo que Claude Sonnet 4.6 o un nivel de razonamiento ligero aporta mejor uso de herramientas y seguimiento de instrucciones. Hasta unos dos segundos de primera respuesta son tolerables cuando los usuarios saben que hablan con una máquina.
- Voz con trabajo complejo de backend: el patrón de cerebro dividido, con audio de relleno que cubre el pensamiento.
- Multilingüe: consulta la clasificación de idiomas para elegir el cerebro y luego confirma que la capa TTS cubre los mismos idiomas. Un modelo que domina un idioma que tu capa de voz no puede hablar es uno de los fallos de producción más comunes.
La regla de BenchLM es breve: elige el modelo más rápido que supere tu listón de seguimiento de instrucciones y uso de herramientas, e ignora la tabla general. Con los datos actuales, eso significa un modelo rápido en la conversación, un modelo de razonamiento en llamadas a herramientas en segundo plano, tokens transmitidos directamente a la capa TTS y un presupuesto de latencia que cubra toda la cadena de voz. Haz bien esas cuatro cosas y un modelo de gama media sonará humano. Hazlas mal y el mejor modelo del mundo se sentirá roto.
Lo esencial de la tecnología en 3 minutos cada mañana
Un correo, cada día laborable, con lo que realmente importa en IA y tecnología.