Google a commencé à déployer Gémeaux 3.8 Flash TTS et Flash-Lite TTSses nouveaux modèles de synthèse vocale conçus pour générer un son artificiel beaucoup plus expressif. La mise à jour permet de cloner des voix autorisées à partir d'un court échantillon et de diriger des scripts avec des nuances émotionnelles, des accents et des pauses, un saut par rapport à la voix off synthétique que nous connaissions jusqu'à présent.
Le changement que les utilisateurs remarqueront le plus est le contrôle de l’interprétation. Jusqu’à présent, obtenir une voix synthétique pour lire un script avec le bon accent, le bon rythme, l’émotion ou les pauses n’était pas chose facile. Google se développe depuis des semaines Gémeaux 3.8 du Flash original, donnant naissance aux modèles en direct et Réflexion étendue en directet étend désormais cette évolution à la voix : Flash TTS et Flash-Lite TTS intègrent déjà des soupirs, des rires et des changements de ton ligne par ligne, comme si un acteur interprétait le texte au lieu de le lire.
Comment fonctionne le clonage vocal sur Gemini
Si vous travaillez dans la création de contenu, la personnalisation est le point fort de cette mise à jour. Gemini 3.8 Flash TTS génère une voix originale à partir d'une description en langage naturel, avec prise en charge de plus de 100 langues et dialecteset propose un catalogue de plus de 2 000 voix prêtes à être produites.
La fonction de réplication reconstruit une identité vocale à partir d'un échantillon de 30 secondes seulement, à condition d'obtenir l'autorisation expresse de l'utiliser. Le système maintient cette voix cohérente pendant des heures d'enregistrement, ouvrant ainsi la porte aux podcasts, aux livres audio, aux voix off et aux agents conversationnels qui doivent diffuser le même épisode après épisode.
La prise en charge de plus de 100 langues et dialectes rend cet outil utile aussi bien pour les projets locaux que pour les productions qui doivent adapter le même script à plusieurs marchés sans enregistrer chaque version à partir de zéro. La combinaison de voix prédéfinies et de voix clonées vous donne la liberté de choisir entre repartir de zéro ou réutiliser une identité vocale existante.
Direction du scénario et scènes avec deux voix dans un seul audio
Au-delà du clonage d'une voix, les modèles acceptent des instructions d'exécution ligne par ligne : changements de dialecte, murmures, rires et autres signaux qui auparavant ne pouvaient être donnés que par un doubleur. C’est pourquoi le résultat s’éloigne d’un discours plat et se rapproche d’une interprétation avec de vraies nuances.
Une autre nouveauté utile pour ceux qui montent des vidéos est la possibilité de générer des conversations entre deux intervenants à partir d'un seul script. Le système attribue et préserve chaque voix tout au long de la scène, il n'est donc pas nécessaire d'enregistrer et d'éditer chaque piste séparément pour obtenir un dialogue naturel.
Cette capacité à maintenir la cohérence vocale pendant des heures d’audio est la même qui sous-tend le développement des modèles Live et Live Extended Thinking au sein de la famille Gemini 3.8. Google présente donc ces outils comme une évolution conjointe : d’abord il a amélioré la conversation en temps réel et maintenant il transfère ce même niveau de contrôle à la parole enregistrée.
Résultats des tests d'IA de Hume
Dans les benchmarks, Gemini 3.8 Flash TTS est arrivé premier dans le Référence de conception vocale de Hume AI, avec 60,8 points dans le test des accents, et Flash avec Flash-Lite occupent les deux premières places dans l'indice général de qualité de ce même test. Ils figurent également parmi les premières positions dans plusieurs langues au sein de Voice Arena. ElevenLabs reste cependant en tête dans les catégories de qualité vocale individuelle et de variation humaine de Hume AI.
Pour l'utilisateur régulier, Flash TTS atteint déjà Carnet Gémeaux et Flash-Lite TTS pour Google Vidéosun outil qui vient d'ouvrir son générateur vidéo Omni à davantage d'utilisateurs. Si vous êtes développeurs, vous pouvez accéder aux deux modèles depuis l'API Gemini et depuis Google AI Studio. Google ajoute également plusieurs obstacles à la réplication vocale : exiger la vérification du consentement, intégrer les filigranes SynthID et les informations d'identification C2PA, et bloquer cette fonctionnalité dans AI Studio au Royaume-Uni, dans l'Espace économique européen, en Inde, au Texas et dans l'Illinois.
FAQ Gemini 3.8 Flash TTS Un échantillon audio de seulement 30 secondes est nécessaire pour reproduire une voix, à condition d'avoir l'autorisation expresse du propriétaire.
La réplication vocale dans Google AI Studio est bloquée au Royaume-Uni, dans l'Espace économique européen, en Inde, au Texas et dans l'Illinois.
Flash TTS est déployé sur Gemini Notebook et Flash-Lite TTS sur Google Vids. Les développeurs peuvent accéder à la fois via l'API Gemini et AI Studio.
Quelle quantité d'audio est nécessaire pour cloner une voix avec Gemini 3.8 Flash TTS ?
Dans quelles régions le clonage vocal est-il bloqué dans AI Studio ?
Où les nouveaux modèles de synthèse vocale Gemini sont-ils disponibles ?