Google présente Gemini 3.5 Transcribe, son modèle voix-texte le plus efficace : il n'a qu'une erreur de 2,6%

Google a présenté Gémeaux 3.5 Transcriptionla dernière mise à jour de son modèle parole-texte au sein de la famille Gemini. L'entreprise le présente comme son système de transcription le plus précis à ce jour, avec des améliorations notables pour gérer le bruit de fond et le jargon technique, un progrès que beaucoup d'entre nous remarqueront dès que nous dicterons une note vocale ou un message depuis notre mobile.

Le nouveau modèle est doté de fonctions qui nécessitaient auparavant une révision manuelle : il corrige les erreurs à la volée, élimine les remplissages vocaux et formate le texte automatiquement, sans que nous ayons à intervenir nous-mêmes. Vous pouvez également distribuer des tâches plus complexes, comme analyser des fichiers ou générer des images, en vous appuyant sur d'autres modèles de la famille Gemini pour terminer le travail sans quitter le même outil.

Un taux d'erreur qui descend à 2,6% dans les transcriptions enregistrées

Google cite les performances de Gemini 3.5 Transcribe avec une métrique spécifique : le taux d'erreur de mots (WER) reste dans la 4,0% en moyenne pour la transcription en streaming et tombe à 2,6% lorsque l'audio est déjà enregistré. Cette précision nous permet de lire de manière fiable des données alphanumériques comme les numéros de commande ou les codes postaux, éléments qui étaient auparavant mal retranscrits et que beaucoup d'entre nous ont dû corriger à la main après chaque dictée.

La société attribue une partie de l’amélioration à la façon dont le modèle interprète la parole naturelle, et pas seulement le son brut. Il reconnaît le vocabulaire personnalisé et les termes spécialisés, ce qui réduit les corrections sur les noms propres ou les concepts techniques qui devaient auparavant être épelés ou revus après chaque séance de dictée. « Gemini 3.5 Transcribe est conçu pour capturer votre style naturel de parole et mieux comprendre votre intention, en plus de reconnaître un vocabulaire personnalisé, afin que vous puissiez exécuter des tâches avec votre voix », a expliqué Google dans la publication avec laquelle il a présenté le modèle.

Quatre-vingt-cinq langues et jusqu'à trois voix différentes

Le modèle fonctionne dans 85 langues et reconnaît les accents régionaux et les variantes dialectales au sein de chacun d'eux, ce qui élargit sa marge de succès dans les conversations où coexistent différentes façons de parler la même langue. Dans les fichiers audio déjà enregistrés, vous pouvez également différencier jusqu'à trois interlocuteurs différents et marquez avec précision le moment exact où chacun intervient, en générant des horodatages automatiques pour chaque intervention.

L'interface Gemini Transcribe AI est désormais disponible via le site officiel. Photo : capture Softzone.

Cette fonction est utile pour les procès-verbaux de réunions, les entretiens ou les analyses après les appels du service client, où savoir qui a parlé et à quelle heure permet d'économiser une grande partie du travail d'édition manuelle qui incombait auparavant à celui qui transcrivait l'audio à la main. Combiné à une reconnaissance de vocabulaire personnalisée, l'outil vous permet de travailler avec des enregistrements mélangeant divers accents et terminologies spécifiques sans perdre l'attribution de chaque voix. Pour ceux d'entre nous qui travaillent régulièrement avec de longs enregistrements, lors de réunions avec des participants de plusieurs pays ou avec des accents différents, cette combinaison de langues, de dialectes et de séparation des voix fait une réelle différence par rapport aux outils que nous utilisions jusqu'à présent, qui avaient tendance à perdre en précision dès que plusieurs accents apparaissaient dans un même enregistrement.

Disponible dès maintenant pour les développeurs ; viendra sur Chrome

Les développeurs peuvent essayer Gemini 3.5 Transcribe en version préliminaire publique via le API Gémeauxdisponible dans Google AI Studio et Google Vertex AI. Grâce à lui, ils peuvent créer des agents vocaux conversationnels, des systèmes de sous-titrage en temps réel pour les diffusions ou les événements en direct, ainsi que des outils d'analyse post-appel qui nécessitaient auparavant des services de transcription externes.

Nous, en tant qu'utilisateurs ordinaires, pouvons déjà remarquer ce changement sur deux points que beaucoup d'entre vous utilisent quotidiennement, j'en suis sûr : l'application Gemini pour macOS et la dictée vocale de Gboard sur Android Ils intègrent le nouveau modèle, comme l'a confirmé Google. L'entreprise a également annoncé que le modèle arriverait bientôt dans Google Chrome, où nous pouvons dicter du texte dans n'importe quel champ du Web sans avoir besoin de clavier, une fonction idéale lorsque nous voulons remplir des formulaires ou rechercher des informations sur Internet sans avoir à taper constamment.

FAQ sur la transcription de Gemini 3.5

Combien de langues Gemini 3.5 Transcribe prend-il en charge ?

Le modèle prend en charge 85 langues et reconnaît les accents régionaux et les variantes dialectales au sein de chacune d'elles.

Quel est le taux d’erreur du nouvel outil de transcription ?

Google rapporte un taux d'erreur de mot (WER) moyen de 4,0 % pour le streaming audio et de 2,6 % pour l'audio enregistré.

Comment les développeurs peuvent-ils accéder au nouveau modèle ?

Vous pouvez l'essayer en avant-première publique via l'API Gemini, disponible dans Google AI Studio et Google Vertex AI.

Le modèle peut-il distinguer plusieurs personnes parlant dans le même audio ?

Oui, dans un audio déjà enregistré, vous pouvez attribuer la parole à jusqu'à trois locuteurs différents avec un horodatage automatique.