SevenTnewS

Qwen / Alibaba Cloud

Qwen2.5-Omni supera a Gemini-1.5-Pro en OmniBench y cabe en menos de 12GB

El Qwen2.5-Omni de código abierto de Alibaba superó a Gemini-1.5-Pro en OmniBench y encabezó la tabla de clasificación de razonamiento de audio MMAU. Las versiones cuantizadas reducen la VRAM a menos de 12GB y la compatibilidad con MNN lleva el chat de voz en tiempo real a los teléfonos.

Emmanuel Fabrice Omgbwa Yasse Asistido por IA

2026-08-07 · 4 min de lectura

Qwen2.5-Omni supera a Gemini-1.5-Pro en OmniBench y cabe en menos de 12GB

El equipo Qwen de Alibaba Cloud lanzó Qwen2.5-Omni el 26 de marzo de 2025, y los números en su repositorio hablan por sí solos. El modelo es multimodal de extremo a extremo: acepta texto, imágenes, audio y video como entrada, y responde con texto en streaming y habla natural. La versión de 7B alcanzó el puesto más alto de la lista de tendencias de Hugging Face el 2 de abril, una variante de 3B le siguió el 30 de abril, y el equipo publicó un informe técnico (arXiv 2503.20215) junto con el lanzamiento.

El resultado principal es la brecha en los benchmarks. En OmniBench, que prueba tareas que obligan al modelo a utilizar varias modalidades a la vez, Qwen2.5-Omni-7B promedió 56,13% y el de 3B obtuvo 52,19%. Gemini-1.5-Pro registró 42,91%. Estas son las cifras publicadas por el propio equipo, y son la razón por la que este lanzamiento merece algo más que una lectura rápida.

El razonamiento de audio cuenta una historia similar. En MMAU, el de 7B promedió 65,60%, por delante del 54,90% registrado por Gemini-Pro-V1.5 en la misma tabla. La actualización del 9 de junio del equipo afirma el primer puesto en la tabla de clasificación de MMAU y el primero entre los modelos de código abierto en MMAR. Tres días después informó del primer puesto entre los modelos de código abierto en MMSU, un benchmark de comprensión y razonamiento del lenguaje hablado.

Benchmark (promedio)Qwen2.5-Omni-7BQwen2.5-Omni-3BGemini-1.5-Pro
OmniBench56,13%52,19%42,91%
MMAU (comprensión de audio)65,60%63,30%54,90%

Cifras tal como se publicaron en el repositorio de Qwen2.5-Omni. La tabla de MMAU etiqueta el resultado de Gemini como Gemini-Pro-V1.5; la tabla de OmniBench utiliza Gemini-1.5-Pro.

Los márgenes se mantienen también en las pruebas de modalidad única. En LibriSpeech test-other, la tasa de error de palabra del 7B es de 3,4, ligeramente mejor que la de Whisper-large-v3, que es de 3,6. En Common Voice 15 supera a Whisper-large-v3 en las cuatro divisiones de idioma enumeradas, incluida una diferencia de 5,2 frente a 12,8 en chino.

Thinker-Talker y habla en tiempo real

La arquitectura es la parte que la mayoría de los lanzamientos ocultan detrás de una API. Qwen2.5-Omni se divide en un Thinker, que razona a través de texto, imágenes, audio y video, y un Talker, que genera habla. Un embedding posicional llamado TMRoPE alinea las marcas de tiempo del video con el audio, de modo que el modelo puede oír lo que sucede en pantalla mientras lo ve. El chat de voz y video en tiempo real se activó en Qwen Chat el mismo día del lanzamiento.

La salida de habla está cerca de los sistemas TTS dedicados. En el conjunto difícil del benchmark SEED, el 7B ajustado con RL registra una tasa de error de palabra de 6,54 para la consistencia de contenido, frente al 1,94 de Seed-TTS_RL y el 6,83 de CosyVoice 2. La similitud del hablante llega a 0,752, justo por debajo del 0,782 de Seed-TTS_RL. Para un modelo que también lee, ve y razona, es un resultado respetable.

La versión de 11,64GB para GPU de consumo

El lanzamiento que importa para quienes no tienen un clúster de GPU llegó el 16 de mayo. El equipo publicó versiones de 4 bits GPTQ-Int4 y AWQ del 7B. Una entrada de video de 15 segundos que necesita 31,11GB de VRAM en BF16 se reduce a 11,64GB con GPTQ-Int4 y a 11,77GB con AWQ. El README menciona RTX 3080, 4080 y 5070 como objetivos. Días antes, la compatibilidad con MNN había llevado el modelo a los teléfonos, con el 7B alcanzando un máximo de 5,8GB de memoria en Snapdragon 8 Gen 1 y 8 Elite, y el 3B en 3,6GB. El 3B más ligero, lanzado el 30 de abril, existe para que más plataformas puedan ejecutar el modelo en absoluto.

Las desventajas son visibles en las mismas tablas. La cuantización cuesta algo de precisión y un poco de velocidad: MMLU-Pro baja de 47,0 a 43,76 en la versión GPTQ, mientras que VideoMME se mantiene en 72,0 en AWQ frente a 72,4 nativo. El equipo señala que las cifras de VRAM son mínimos teóricos, y el uso real es unas 1,2 veces mayor. La cifra de 11,64GB también cubre solo 15 segundos de video. A 60 segundos asciende a 29,51GB. La historia de "menos de 12GB" tiene poca capacidad de atención.

Dónde flaquean las cifras auto-reportadas

El despliegue tiene sus inconvenientes. vLLM serve, la vía estándar de servicio compatible con OpenAI, solo admite el Thinker, lo que significa salida de texto únicamente; la generación de audio requiere el script end2end. El modelo de API DashScope qwen-omni-turbo es solo streaming. Y la salida de audio depende de un prompt de sistema específico, "You are Qwen, a virtual human...", o es posible que no se genere habla en absoluto.

Todas las cifras anteriores provienen del equipo que construyó el modelo. La verificación independiente de los modelos omni es más escasa que la de los LLM de solo texto, porque los entornos de evaluación son más nuevos. Lo que se sostiene al inspeccionarlo es la dirección: un 7B de código abierto superó a un modelo cerrado insignia en tareas multimodales integradas, y una versión de 4 bits pone la interacción de voz en tiempo real al alcance de una GPU de 12GB. Si las pruebas de terceros confirman los márgenes es la pregunta que debería responder la próxima ronda de benchmarks.

Lo esencial de la tecnología en 3 minutos cada mañana

Un correo, cada día laborable, con lo que realmente importa en IA y tecnología.