SevenTnewS

Análisis de modelo

Qwen2.5-Omni: el modelo de código abierto que finalmente hace lo que los competidores solo prometen

Una inmersión profunda en el modelo de código abierto que procesa simultáneamente texto, imágenes, audio y video mientras genera voz en streaming, superando a GPT-4o-mini y Gemini en múltiples evaluaciones, y que cabe en una sola GPU de consumo con cuantización.

Emmanuel Fabrice Omgbwa Yasse Asistido por IA

2026-08-03 · 4 min de lectura

Qwen2.5-Omni: el modelo de código abierto que finalmente hace lo que los competidores solo prometen

El equipo Qwen de Alibaba ha lanzado Qwen2.5-Omni, un modelo multimodal de 7 mil millones de parámetros que maneja texto, imágenes, audio y video al mismo tiempo, y puede generar voz en streaming como salida. En evaluaciones, supera a rivales de código abierto y competidores propietarios, todo mientras se ejecuta en una sola GPU.

El modelo utiliza una arquitectura Thinker-Talker que separa la percepción de la generación. El Thinker se encarga de la codificación multimodal. El Talker sintetiza voz o texto en streaming. Una inserción posicional personalizada, TMRoPE, sincroniza las marcas de tiempo de video con el audio, lo que permite al modelo comprender entre modalidades en tiempo real.

Lo que diferencia a Qwen2.5-Omni del resto es la amplitud de su rendimiento. En OmniBench, una evaluación que mide la comprensión de voz, eventos sonoros y música, la versión de 7B obtiene un 56,13%, una ventaja de 13 puntos sobre Gemini 1.5 Pro (42,91%). En razonamiento auditivo (MMAU), alcanza un 65,6% en general, superando a Gemini-Pro-V1.5 (54,9%) y Qwen2-Audio (49,2%). La calidad de generación de voz también es sólida: en el conjunto de prueba SEED test-hard, la variante ajustada con RL tiene una tasa de error de palabras del 6,54%, comparable a modelos TTS especializados como Seed-TTS_RL (6,42%).

Quizás más llamativa es la comprensión de imágenes del modelo. A pesar de ser un modelo omni, Qwen2.5-Omni-7B iguala al modelo de visión dedicado Qwen2.5-VL-7B en MMMU (59,2 vs. 58,6), lo supera en MMStar (64,0 vs. 63,9) y empata en MathVision (25,0 vs. 25,1). En la evaluación de OCR DocVQA, obtiene un 95,2% frente al 95,7% de Qwen2.5-VL-7B, una diferencia insignificante. GPT-4o-mini queda rezagado en la mayoría de las evaluaciones de visión: MMMU 60,0 vs. 59,2, MathVista 52,5 vs. 67,9, MMStar 54,8 vs. 64,0.

La comprensión de video sigue la misma historia. En Video-MME con subtítulos, Qwen2.5-Omni-7B alcanza un 72,4%, superando a Qwen2.5-VL-7B (71,6%) y GPT-4o-mini (64,8%). En MVBench obtiene un 70,3 frente al 69,6 de su contraparte solo de visión.

Arquitectura y entrenamiento

La arquitectura Thinker-Talker es más que un nombre ingenioso. El Thinker es un Transformer solo decoder que utiliza Qwen2.5 como base, con codificadores de audio y video añadidos. Utiliza atención causal en todas las modalidades; el modelo procesa las entradas de forma secuencial y en contexto, sin módulos de fusión separados. El Talker, un decoder ligero, toma el último estado oculto del Thinker y genera tokens de texto o tokens de voz a través de un codec. Los dos módulos comparten parámetros mediante un entrenamiento intercalado: el Thinker se actualiza en cada paso, pero el Talker solo durante la generación de voz.

El entrenamiento se realizó en tres etapas: alineación de modalidades con 1,2 billones de tokens de datos diversos, ajuste fino supervisado multitarea en 1,3 millones de muestras de texto-imagen-video y 170.000 horas de audio, y aprendizaje por refuerzo a partir de retroalimentación humana para la calidad de la voz. El resultado es un modelo que puede escuchar una pregunta, ver un video, razonar sobre ambos y responder con voz natural, todo en un solo paso directo.

Implementación práctica

A diferencia de los modelos omni de Google u OpenAI que requieren APIs en la nube, Qwen2.5-Omni se ejecuta en hardware de consumo. La versión de 7B necesita 31 GB de memoria GPU en BF16 con FlashAttention-2, lo que cabe en una RTX 4090. Las versiones cuantizadas (GPTQ-Int4, AWQ) reducen la memoria por debajo de 12 GB, cabiendo en una RTX 3080 o 4080. Existe una variante de 3B para dispositivos periféricos, con soporte MNN para SoCs móviles: en un Snapdragon 8 Elite, el Thinker decodifica a 11,52 tok/s y genera voz a 27,36 tok/s.

La implementación es sencilla. El modelo está integrado en las últimas versiones de Hugging Face Transformers (v4.52.3) y vLLM. Hay imágenes Docker disponibles. Los fragmentos de código en el repositorio muestran inferencia en menos de 20 líneas de Python.

Qué necesita mejorar

El rendimiento solo de texto va por detrás de los modelos de lenguaje puro de tamaño similar. En MMLU-Pro, Qwen2.5-Omni-7B obtiene 47,0, frente a 56,3 de Qwen2.5-7B. La brecha sugiere que el entrenamiento multimodal impone un compromiso en el razonamiento solo de lenguaje. El modelo también requiere un sistema de prompt específico para generar voz, una restricción frágil para los desarrolladores que desean personalizar el comportamiento. Y aunque el rendimiento en OmniBench es impresionante, aún no ha sido replicado de forma independiente por terceros.

La salida de voz actualmente solo admite dos voces preestablecidas (Chelsie y Ethan), aunque el servicio API de Alibaba Cloud ofrece cuatro. No se documenta el ajuste fino local para voces personalizadas.

Veredicto

Qwen2.5-Omni es un logro poco común: un modelo de código abierto que establece un nuevo estándar en su dominio mientras se ejecuta en hardware que los desarrolladores ya poseen. No solo iguala a los competidores propietarios en tareas omni, sino que los supera en la mayoría de las evaluaciones. El compromiso solo de texto es real, pero aceptable para un modelo diseñado para unificar modalidades. Para cualquiera que construya agentes de voz en tiempo real, canalizaciones de comprensión de video o asistentes multimodales, este es el modelo de código abierto por el que empezar.

Lo esencial de la tecnología en 3 minutos cada mañana

Un correo, cada día laborable, con lo que realmente importa en IA y tecnología.