Aller au contenu principal
Live
Intelligence artificielleUSUS

Google lance Gemini 3.8 Flash TTS et Flash-Lite TTS

Google met à disposition Gemini 3.8 Flash TTS et Flash-Lite TTS, deux modèles de synthèse vocale couvrant plus de 100 langues. Le premier génère des voix inédites à partir de descriptions textuelles, le second vise la production audio à bas coût.

4 min de lectureMis à jour il y a 12 h
Google affirme que ses nouveaux modèles dominent la plupart des catégories du benchmark de synthèse vocale de Hume AI
Crédit image : Google
Dans cet article
  1. Deux modèles aux usages distincts
  2. Créer une voix à partir d'une description
  3. Contrôle du jeu et des dialogues
  4. Déploiement et tarification

Deux modèles aux usages distincts

Google enrichit son offre de synthèse vocale avec Gemini 3.8 Flash TTS et Gemini 3.8 Flash-Lite TTS, rapporte The Decoder. Les deux modèles couvrent plus de 100 langues et acceptent des indications de jeu pour chaque réplique.

Le premier s'adresse aux projets créatifs : personnages de jeux vidéo, livres audio, podcasts. Le second cible la génération de parole à grande échelle et à faible coût, pour le doublage, les contenus audio et les agents vocaux.

Créer une voix à partir d'une description

Avec Gemini 3.8 Flash TTS, l'utilisateur peut concevoir une voix de zéro. Un prompt textuel définit son rôle, son accent et ses caractéristiques vocales, dans de nombreuses langues et dialectes. Google propose également une bibliothèque de plus de 2 000 voix prédéfinies, dont des variantes régionales comme l'espagnol mexicain, le français québécois ou l'anglais écossais.

Une fonction de clonage vocal construit un profil à partir d'un échantillon audio de 30 secondes. La personne dont la voix est clonée doit enregistrer une déclaration de consentement, et la voix de cet enregistrement doit correspondre à l'échantillon. Chaque clip produit par les modèles audio de Gemini porte un filigrane SynthID inaudible, destiné à détecter les contenus générés par IA.

Google a aussi annoncé « Voice Remixing », qui permettra de modifier le timbre, la hauteur, le tempo et l'accent des voix de la bibliothèque. Cette fonction n'est pas encore disponible.

Contrôle du jeu et des dialogues

Les deux modèles acceptent des indications écrites pour chaque réplique, ou peuvent interpréter seuls les indications du script. Selon Google, ils génèrent des heures d'audio avec une dérive minimale du locuteur, la voix évoluant très peu dans le temps.

Un mode à deux voix produit un dialogue à partir d'un seul script tout en gardant les timbres distincts. Il est possible d'intégrer rires, soupirs et sons comme « mhm » pour placer réactions et pauses au moment voulu.

Lors de deux tests personnels, un prompt de style a demandé à une voix prédéfinie d'imiter un Berlinois agacé parlant anglais avec un fort accent allemand. Les contrôles de style ont produit un accent et une intonation convaincants, mais les deux essais comportaient un sifflement aigu en arrière-plan. Dans l'un d'eux, la voix changeait aussi à la fin du clip.

Déploiement et tarification

Les deux modèles sont déployés via la Gemini API et Google AI Studio. Flash TTS est aussi disponible dans Gemini Notebook, et Flash-Lite TTS dans Google Vids. L'accès via la Gemini Enterprise API suivra prochainement pour les deux.

Des plateformes de développement comme Agora, LiveKit, Pipecat et Vercel prennent déjà en charge l'intégration via la Gemini API. Google n'a pas encore listé de points de terminaison régionaux pour ces modèles, alors que les précédents modèles TTS proposaient un traitement des données dans l'UE.

Selon Google, les données du niveau gratuit servent à améliorer ses produits, contrairement à celles du niveau payant. La tarification payante est exprimée en dollars par million de jetons, les jetons texte étant facturés en entrée et les jetons audio en sortie.

Google indique qu'une seconde d'audio généré équivaut à 25 jetons audio, soit 90 000 jetons pour une heure. Une heure de sortie audio coûte donc 0,81 $ avec Flash TTS et 0,54 $ avec Flash-Lite TTS jusqu'à fin 2026. Au 1er janvier 2027, ces coûts passent à 1,62 $ et 1,08 $, l'entrée texte étant facturée séparément.

Maillage