SevenTnewS

Inteligencia Artificial

El modelo de 7B que supera a los más grandes, funciona en un teléfono y cambia la ecuación de costos de la IA

El Qwen2.5-Omni de Alibaba Cloud es un modelo de 7B que maneja texto, imágenes, audio y video, generando voz y texto en tiempo real. Su arquitectura Thinker-Talker y la incrustación posicional TMRoPE permiten la interacción en streaming, y la variante de 3B se ejecuta en SoCs móviles como Snapdragon 8 Gen 1 a velocidades utilizables.

Emmanuel Fabrice Omgbwa Yasse Asistido por IA

2026-07-23 · 4 min de lectura

El modelo de 7B que supera a los más grandes, funciona en un teléfono y cambia la ecuación de costos de la IA
Fuentes : QwenLM/Qwen2.5-…·Alibaba Cloud A…

La mayoría de los modelos multimodales apilan codificadores separados para cada modalidad y lo dejan así. Qwen2.5-Omni hace algo diferente. Trata el texto, las imágenes, el audio y el video como ciudadanos de primera clase dentro de una arquitectura única de extremo a extremo y genera tanto texto como voz natural de manera continua. El modelo, lanzado por el equipo Qwen en Alibaba Cloud a finales de marzo de 2025, ha encabezado la página de tendencias de Hugging Face dos veces y ha llegado a los entornos de ejecución móviles a través de MNN. Esto es parte de un impulso más amplio de Alibaba para llevar la IA más allá del laboratorio, como se ve en su apuesta de infraestructura de 53 mil millones de dólares.

Dos opciones arquitectónicas distinguen a Qwen2.5-Omni. Primero, la separación Thinker-Talker: un módulo Thinker maneja la percepción y el razonamiento multimodal, mientras que un módulo Talker maneja la generación de voz. Esto permite que el modelo decodifique texto y audio en paralelo en lugar de en secuencia, razón por la cual puede transmitir una respuesta hablada mientras aún termina su oración. Segundo, TMRoPE (Time-aligned Multimodal RoPE) alinea las incrustaciones posicionales de los fotogramas de video con sus marcas de tiempo de audio correspondientes, para que el modelo entienda que un evento visual y un sonido pertenecen al mismo momento. El problema de sincronizar señales multimodales es un desafío conocido que otras arquitecturas también abordan, como se explora en una IA que corrige sus propias salidas multimodales.

Gráfico: Comparación de Precisión en OmniBench
Qwen2.5-Omni-7B supera a Gemini 1.5 Pro y MiniCPM-o en OmniBench, según se informa en el artículo.

La versión de 7B ofrece puntuaciones competitivas o mejores en la mayoría de los puntos de referencia en comparación con modelos de tamaño similar. En OmniBench, que prueba el razonamiento de voz a texto a través de sonidos, música y habla, Qwen2.5-Omni-7B alcanzó un 56.13% de precisión, muy por delante del 42.91% de Gemini 1.5 Pro y del 40.50% de MiniCPM-o. En MMAU, un punto de referencia de comprensión y razonamiento de audio, obtuvo un 65.60% en general, superando a Qwen2-Audio por más de 16 puntos. En comprensión de video sin subtítulos (Video-MME), alcanzó un 64.3%, cerca de Qwen2.5-VL-7B y GPT-4o-mini. La variante de 3B, lanzada un mes después, se mantiene competitiva: 52.19% en OmniBench y 63.30% en MMAU. Estos puntos de referencia destacan una tendencia más amplia de modelos más pequeños desafiando a los más grandes, un patrón visible en el modelo Laguna XS que superó a modelos de 137B.

Los números que importan para el despliegue están en el lado de los recursos. El modelo de 3B requiere aproximadamente 3.6 GB de memoria máxima en un SoC móvil y ejecuta la decodificación de Thinker a 15.84 tok/s en un Snapdragon 8 Gen 1, o 23.31 tok/s en un 8 Elite. Los módulos Talker y Code2Wav añaden latencia, pero el rendimiento total de extremo a extremo se mantiene en el rango de 8 a 20 tok/s para la decodificación, dependiendo del hardware. Esto coloca a un asistente multimodal en tiempo real dentro del presupuesto térmico de un teléfono, no solo en una demostración. La capacidad de ejecutar tales modelos en el dispositivo tiene implicaciones para los agentes autónomos que necesitan respuestas de baja latencia, como se discute en arquitecturas de agentes paralelos.

La variante de 7B en BF16 necesita aproximadamente 31 GB para una entrada de video de 15 segundos, lo que descarta el móvil pero se sienta cómodamente en una sola A100 o RTX 6000 Ada. Las versiones cuantizadas de 4 bits (GPTQ-Int4, AWQ) reducen la memoria en más del 50% con pequeñas caídas de precisión: 3.71 WER en LibriSpeech test-other frente a 3.4 para el modelo completo, 43.76 en MMLU-Pro frente a 47.0. Estos están mayormente dentro del ruido para uso en producción.

La historia del despliegue móvil es la parte que vale la pena observar. La integración de MNN significa que Qwen2.5-Omni ejecuta inferencia en el dispositivo en Snapdragon 8 Gen 1, 8 Elite, y probablemente otros ahora. La huella de memoria, 5.8 GB pico para el 7B en el teléfono, 3.6 GB para el 3B, es alta pero no prohibitiva para dispositivos de gama alta. Los modelos basados en Neural Engine de Apple y los chips Tensor de Google tendrán sus propias respuestas, pero el hecho de que un modelo omni de 7B con pesos abiertos quepa en la RAM de un teléfono no es algo que nadie hubiera apostado hace dos años. Este cambio en la capacidad en el dispositivo está remodelando cómo se despliegan los agentes de IA, un tema cubierto en la suposición de 314 mil millones de dólares que se rompió.

El documento es honesto sobre las limitaciones. La arquitectura Thinker-Talker no puede manejar una configuración de prompt sin restricciones para la salida de audio; el prompt del sistema debe establecerse en una cadena de identidad específica para que funcione la generación de voz. El módulo Talker añade aproximadamente 2 GB de memoria GPU, y deshabilitarlo ahorra eso a costa de una salida solo de texto. El soporte de URL de video depende del backend (torchvision >= 0.19.0 maneja HTTP y HTTPS; decord maneja solo HTTP). Y el servicio de vLLM, a partir de mayo de 2025, solo soporta al Thinker; la salida de audio requiere una bifurcación de vLLM personalizada. Estos son vacíos de ingeniería solucionables, no fallos fundamentales.

Lo que Qwen2.5-Omni muestra es que los modelos omni-modales ya no son solo curiosidades de investigación. Un modelo que supera a los reconocedores de voz dedicados, a los razonadores de imágenes y a los puntos de referencia de video, y que funciona en un teléfono, cambia la ecuación de costos para los asistentes de voz en tiempo real, las herramientas de accesibilidad y el análisis de video en vivo. La siguiente pregunta es si Alibaba Cloud lo convertirá en un producto lo suficientemente rápido como para que importe, o dejará eso a quien construya primero sobre los pesos abiertos. La estrategia más amplia de la compañía sugiere que ya está pensando más allá de los modelos, como se ve en su enfoque de plataforma primero.

Lo esencial de la tecnología en 3 minutos cada mañana

Un correo, cada día laborable, con lo que realmente importa en IA y tecnología.