SevenTnewS

TTS Open Source

Le nouveau modèle TTS d'Audio8 clone les voix en 11 langues gratuitement

Audio8 publie Audio8-TTS Preview sous licence Apache 2.0, un modèle de 0,6B prenant en charge 11 langues, le clonage vocal zero-shot, et un codec 44,1 kHz intégré. Cette version cible les applications vocales en périphérie nécessitant rapidité et confidentialité.

Emmanuel Fabrice Omgbwa Yasse Assisté par IA

2026-07-30 · 1 min de lecture

Le nouveau modèle TTS d'Audio8 clone les voix en 11 langues gratuitement
Sources : Samuel Zeng thr…

Le nouveau modèle d'Audio8 brouille la frontière entre la synthèse vocale basée sur le cloud et la synthèse locale. Annoncé aujourd'hui, l'aperçu Audio8-TTS regroupe 0,6 milliard de paramètres, un clonage vocal zero-shot dans 11 langues, un codec audio 44,1 kHz, le tout sous Apache 2.0, s'alignant sur le mouvement des poids ouverts que 41 signataires viennent de défendre dans une lettre publique.

Avec 0,6 milliard de paramètres, le modèle fonctionne sur du matériel grand public et clone une voix à partir d'un court échantillon sans réglage fin. Audio8 le qualifie de pile unique pour les applications vocales nécessitant rapidité, portée et confidentialité. Fonctionner localement signifie qu'aucun audio ne quitte l'appareil, un avantage en matière de confidentialité de plus en plus demandé par les déploiements en entreprise, comme le montre une comparaison des stratégies d'infrastructure IA.

Les petits modèles vocaux rattrapent rapidement leur retard. Voxtral Realtime, un modèle ASR en streaming open source, a égalé la qualité de Whisper avec un délai de 480 ms plus tôt cette année. Le Qwen2.5-Omni d'Alibaba fonctionne sur un téléphone. Le Cosmos 3 Edge de Nvidia intègre également la modélisation du monde dans 4 milliards de paramètres pour des tâches sur l'appareil, se classant premier sur VANTAGE-Bench dans sa catégorie de taille. L'approche d'Audio8 est générative : elle crée de la parole plutôt que de la transcrire. Avec 0,6 milliard de paramètres, il reste sous la barre du milliard où se situent la plupart des modèles TTS ouverts, et le clonage zero-shot fonctionne de l'anglais au mandarin.

Le codec 44,1 kHz intégré élimine le besoin d'un vocodeur séparé et fournit une sortie propre par défaut. Le

L'essentiel de la tech en 3 minutes chaque matin

Un email, chaque jour ouvré, avec ce qui compte vraiment en IA et en tech.