SevenTnewS

IA multimodal

Qwen2.5-Omni de Alibaba quiere ser el modelo que oye, ve y habla, todo a la vez

Qwen2.5-Omni de Alibaba Cloud procesa texto, imágenes, audio y video de extremo a extremo, generando texto y habla natural en tiempo real. Los puntos de referencia muestran que a menudo iguala o supera a los modelos especializados de modalidad única, lo que sugiere un cambio hacia arquitecturas unificadas.

Emmanuel Fabrice Omgbwa Yasse Asistido por IA

2026-07-20 · Última actualización: 2026-08-03 · 5 min de lectura

Qwen2.5-Omni de Alibaba quiere ser el modelo que oye, ve y habla, todo a la vez

El panorama de los modelos de IA se ha organizado durante mucho tiempo por sentido: modelos de visión para imágenes, modelos de audio para sonido, modelos de texto para lenguaje. Pero esa taxonomía solo tiene sentido dentro de un laboratorio de investigación. En el mundo real, una conversación implica expresiones faciales, tono de voz y las palabras mismas, todo a la vez. El equipo Qwen de Alibaba Cloud apuesta a que la próxima frontera es simplemente todo a la vez.

Con el lanzamiento de Qwen2.5-Omni, la empresa envía un modelo multimodal de extremo a extremo que ingiere texto, imágenes, audio y video, y genera tanto texto como habla natural de forma continua. El modelo es de código abierto (las versiones de 7B y 3B de parámetros están disponibles bajo licencias permisivas) y el equipo ha publicado un informe técnico detallado. Pero los números por sí solos cuentan una historia que exige atención.

Un rival tanto para Gemini como para la propia familia Qwen

Uno de los resultados más sorprendentes en el artículo de Qwen2.5-Omni es la tabla OmniBench: en el punto de referencia de comprensión y razonamiento del lenguaje hablado MMSU, el modelo de 7B obtuvo 61,32, solo superado por el 57,25 de Baichuan-Omni-1.5 entre pares de código abierto, pero crucialmente por delante de todas las demás alternativas abiertas. En el conjunto OmniBench más amplio, que prueba voz, eventos sonoros y música, Qwen2.5-Omni-7B alcanzó el 56,13%, superando con creces el 42,91% de Gemini-1.5-Pro y el 40,50% de MiniCPM-o. En razonamiento solo de audio a través de MMAU, obtuvo 65,60, superando por mucho a Qwen2-Audio (49,20) e incluso a Gemini-Pro-V1.5 (54,90).

Pero lo que realmente llama la atención es cómo se compara el modelo con sus propios hermanos especializados. Las puntuaciones de imagen a texto de Qwen2.5-Omni-7B en MMMU (59,2), MathVista (67,9), TextVQA (84,4) y DocVQA (95,2) están a un paso de las cifras de Qwen2.5-VL-7B: 58,6, 68,2, 84,9 y 95,7 respectivamente. Los puntos de referencia de video son igualmente ajustados: en MVBench, el modelo ómnimo supera ligeramente a la variante solo de visión, 70,3 frente a 69,6. La implicación es que agregar comprensión de audio y habla no degradó el rendimiento de la visión, un logro arquitectónico no trivial.

En el lado del audio, la tasa de error de palabras (WER) de ASR de Qwen2.5-Omni-7B en LibriSpeech test-other es de 3,4, igualando a Whisper-large-v3 y superando a Llama-3-8B (3,4 frente a un reportado 3,5). En Common Voice inglés, alcanza 7,6, nuevamente competitivo con el 9,3 de Whisper-large-v3. Para la traducción de voz a texto en CoVoST2 (en-de), obtiene 30,2, por delante de Qwen2-Audio (29,9) y MiniCPM-o (que no reportó inglés a alemán). Las métricas de generación de habla, WER en el punto de referencia Seed-TTS hard, son de 6,54 para el modelo RL, competitivo con el 8,08 de CosyVoice 2-S y el 6,42 de Seed-TTS_RL.

La arquitectura: Thinker y Talker

Internamente, Qwen2.5-Omni utiliza una arquitectura de dos bloques llamada Thinker-Talker. El Thinker es un transformador multimodal que intercala tokens de texto, imagen, audio y video utilizando una incrustación de posición personalizada llamada TMRoPE (Time-aligned Multimodal RoPE), que sincroniza los fotogramas de video con sus pistas de audio a nivel de marca de tiempo. El Talker es un decodificador de habla dedicado que toma los estados ocultos del Thinker y produce una salida de audio continua. Esta separación permite que el sistema, por ejemplo, transcriba una consulta hablada del usuario mientras genera una respuesta hablada sin esperar a que termine toda la entrada.

El modelo también admite la entrada de audio fragmentado para interacción en tiempo real, una característica que el equipo demostró a través de la interfaz de chat de voz y video de Qwen Chat, y que ahora está disponible para desarrolladores a través de una API compatible con OpenAI en DashScope.

Pero la hazaña más interesante podría ser ejecutarse en un teléfono

Quizás el logro más práctico aquí no sea una puntuación de punto de referencia, sino una tabla de consumo de memoria. Qwen2.5-Omni-7B en BF16 requiere 31,11 GB para una entrada de video de 15 segundos, muy por encima de lo que una GPU de consumo puede manejar. Pero el equipo lanzó versiones cuantificadas de 4 bits (GPTQ-Int4 y AWQ) que reducen ese requisito a 11,64 GB y 11,77 GB respectivamente, lo que permite la inferencia en una RTX 3080 o 4080. Aún más impresionante, el modelo ahora se ejecuta en dispositivos periféricos a través de MNN: una variante de 7B en un teléfono Snapdragon 8 Gen 1 utiliza 5,8 GB de RAM máxima y decodifica 11,52 tokens por segundo, lento pero utilizable para chat de voz básico. Un modelo de 3B en un Snapdragon 8 Elite eleva la decodificación a 23,31 tok/s.

Movilizar un modelo que comprende preguntas habladas sobre una transmisión de cámara en vivo mientras habla no es solo una demostración; abre casos de uso en servicio de campo, accesibilidad y traducción en tiempo real que habrían requerido varios modelos separados unidos.

Implicaciones empresariales: el Qwen aislado

Qwen2.5-Omni también llega junto con una jugada de infraestructura: el Hermetic AI Sandbox, una arquitectura de referencia de Arslan ud Din Shafiq, MVP de Alibaba Cloud, para implementar modelos Qwen en VPC completamente aisladas sin acceso a internet. La configuración utiliza los Grupos de Recursos Dedicados de PAI-EAS de Alibaba Cloud, puntos finales de VPC para almacenamiento OSS y DNS de PrivateZone para enrutar las cargas de peso del modelo sin tocar nunca la internet pública. Establece explícitamente "enable_internet_access": false y sustituye las cadenas de herramientas RAG externas con proxies internos que extraen datos de Jira, Confluence o bases de datos locales.

Esto es importante porque el cumplimiento normativo en banca, atención médica y defensa a menudo bloquea la implementación de IA generativa. Mostrar un camino para implementar el mismo modelo de última generación sin que ninguna llamada API salga de la VPC podría desbloquear ciclos de adquisición que estaban estancados.

La desventaja: sin el pulido de Siri en la muñeca todavía

Eso no quiere decir que Qwen2.5-Omni esté listo para reemplazar a los asistentes de voz especializados. La vista previa de watchOS 27 beta de The Verge, en comparación, destaca cómo la IA de Siri de Apple se beneficia de una integración estrecha, respuestas consistentes en el teléfono y el reloj, contexto compartido y una década de refinamiento de la interfaz de usuario. Un modelo multimodal de propósito general aún no tiene esa ventaja. El chat de voz de Qwen2.5-Omni en un teléfono funciona, pero la latencia, la fragilidad del mensaje (el mensaje del sistema debe establecerse textualmente para que la salida de audio funcione) y la falta de una experiencia pulida de palabra de activación lo mantienen en el entorno de pruebas del desarrollador por ahora.

Aún así, la dirección técnica es clara. Donde 2024 fue el año del modelo de chat, 2025 se perfila cada vez más como el año de la IA que camina, habla y ve. Qwen2.5-Omni muestra que las arquitecturas unificadas pueden igualar a las especializadas sin concesiones, y que el código abierto puede impulsar esa frontera tan rápido como los laboratorios más grandes. La pregunta ahora es menos si los modelos multimodales llegarán, y más quién los hará sentir naturales primero.

Lo esencial de la tecnología en 3 minutos cada mañana

Un correo, cada día laborable, con lo que realmente importa en IA y tecnología.