TTS de código abierto
El nuevo modelo TTS de Audio8 clona voces en 11 idiomas de forma gratuita
Audio8 lanza Audio8-TTS Preview bajo Apache 2.0, un modelo de 0.6B que admite 11 idiomas, clonación de voz zero-shot y un códec de 44.1 kHz incluido. El lanzamiento apunta a aplicaciones de habla en el borde que necesitan velocidad y privacidad.
Emmanuel Fabrice Omgbwa Yasse Asistido por IA
2026-07-30 · 1 min de lectura

El nuevo modelo de Audio8 difumina la línea entre la síntesis de voz basada en la nube y la local. Anunciado hoy, el preview de Audio8-TTS incluye 0.6 mil millones de parámetros, clonación de voz zero-shot en 11 idiomas, un códec de audio de 44.1 kHz integrado, todo bajo Apache 2.0, alineándose con el movimiento de pesos abiertos que 41 firmantes acaban de defender en una carta pública.
Con 0.6B parámetros, el modelo se ejecuta en hardware de consumo y clona una voz a partir de una muestra corta sin ajuste fino. Audio8 lo llama una pila única para aplicaciones de voz que necesitan velocidad, alcance y privacidad. Ejecutarse localmente significa que ningún audio sale del dispositivo, una ventaja de privacidad cada vez más demandada por implementaciones empresariales, como se cubrió en una comparación de estrategias de infraestructura de IA.
Los modelos de voz pequeños están alcanzando rápidamente. Voxtral Realtime, un modelo ASR de transmisión de código abierto, igualó la calidad de Whisper con un retraso de 480 ms a principios de este año. El Qwen2.5-Omni de Alibaba se ejecuta en un teléfono. El Cosmos 3 Edge de Nvidia, de manera similar, empaqueta el modelado del mundo en 4 mil millones de parámetros para tareas en el dispositivo, clasificándose primero en VANTAGE-Bench en su clase de tamaño. El enfoque de Audio8 es generativo: crea voz en lugar de transcribirla. Con 0.6B parámetros, se mantiene por debajo del umbral de 1B donde se encuentran la mayoría de los modelos TTS abiertos, y la clonación zero-shot funciona desde inglés hasta mandarín.
El códec de 44.1 kHz integrado elimina la necesidad de un vocoder separado y proporciona una salida limpia por defecto. El
Lo esencial de la tecnología en 3 minutos cada mañana
Un correo, cada día laborable, con lo que realmente importa en IA y tecnología.