SevenTnewS

clonación de voz

5 published articles

IA4 min read

IA en el borde

El runtime solo para CPU de Audio8 permite que la clonación de voz quepa en aproximadamente 1 GiB de RAM

El ONNX Runtime de Audio8 ejecuta la vista previa de TTS de 0,6B enteramente en CPU: pesos autorregresivos INT4, un códec de 44,1 kHz incluido, PCM en streaming y un endpoint compatible con OpenAI. El servicio ocupa aproximadamente 1 GiB de RAM en una laptop, y no se necesitan PyTorch ni Transformers en tiempo de ejecución.

2026-08-05

IAFeatured1 min read

TTS de código abierto

El nuevo modelo TTS de Audio8 clona voces en 11 idiomas de forma gratuita

Audio8 lanza Audio8-TTS Preview bajo Apache 2.0, un modelo de 0.6B que admite 11 idiomas, clonación de voz zero-shot y un códec de 44.1 kHz incluido. El lanzamiento apunta a aplicaciones de habla en el borde que necesitan velocidad y privacidad.

2026-07-30

IAFeatured1 min read

IA e Investigación

Una tasa de acierto del 68% hace que ElevenLabs parezca vulnerable

Voxtral TTS establece un nuevo estándar para la clonación de voz multilingüe, ganando el 68.4% de las comparaciones de preferencia frente a ElevenLabs Flash v2.5. La arquitectura híbrida del modelo y el lanzamiento de pesos abiertos podrían remodelar el panorama de la TTS.

2026-07-24

IAFeatured3 min read

Inteligencia Artificial

Los 'eh' y 'um' perdidos que finalmente hacen que el habla de la IA suene humana

Speech 2.8 de MiniMax incorpora palabras de relleno nativas, respiración y hesitaciones a la síntesis de voz de IA, resolviendo el problema de 'demasiado perfecto' que durante mucho tiempo ha hecho que el habla sintética suene robótica. El modelo también ofrece clonación de voz en 10 segundos y mejoras en la precisión entre idiomas.

2026-07-11

IA2 min read

Voz IA

MiniMax Speech 2.8 aporta calidez humana a las voces de IA con muletillas nativas y clonación de alta fidelidad

MiniMax Speech 2.8 añade muletillas naturales, clonación de voz en 10 segundos y audio de calidad de estudio para cerrar la brecha entre el habla sintética y la humana. El modelo soluciona el problema de 'demasiado perfecto' que hace que las voces de IA suenen robóticas.

2026-07-08