Test canonique sur Ubuntu 26.10 une fonctionnalité de saisie vocale d'intelligence artificielle appelée Mynacapable de transcrire du texte dans n'importe quel champ actif sans connexion Internet. L'outil, encore en développement, permet déjà d'activer la reconnaissance vocale avec un raccourci clavier et a commencé à montrer ses premières pièces visibles alors que le système entre dans la phase de gel des fonctions avant le lancement.
Cette semaine, une extension GNOME Shell a été ajoutée aux installations par défaut d'Ubuntu 26.10 qui affiche un indicateur à l'écran lorsque Myna écoute et enregistre de l'audio. Il convient de préciser que Myna n'est pas cette extension : c'est un orchestrateur qui charge un modèle d'intelligence artificielle, gère l'activation par raccourci clavier, envoie l'audio du microphone au modèle et renvoie la transcription dans le champ de texte de l'application en utilisant IBus. L'extension n'est que la partie visible, celle qui vous avertit que le système traite votre voix.
Comment activer la dictée et ce que nous voyons à l'écran
Pour dicter avec Myna, placez simplement le curseur dans le champ de texte où vous souhaitez écrire et appuyez sur Super+T. Contrairement à ce que Canonical avait décrit précédemment, il n'est plus nécessaire de maintenir la combinaison enfoncée : un simple appui active l'écoute. Un indicateur (OSD) apparaît sur l'écran avec une onde animée qui oscille pendant que vous parlez, comme confirmation visuelle que le microphone capte l'audio.
Un nouvel appui sur le même raccourci arrête l'écoute, l'animation s'aplatit et le système retranscrit l'audio en arrière-plan. Après une brève pause, le texte apparaît dans le champ choisi. Dans les tests que nous avons pu effectuer, les entrées sont arrivées correctement dans la plupart des applications testées, y compris l'éditeur de texte Ubuntu, la présentation de GNOME Shell et le navigateur. Firefoxbien qu'avec une certaine lenteur typique d'une version de développement exécutée à partir du code source dans une machine virtuelle.
Selon la spécification Myna, la fermeture ou la réduction de la fenêtre cible après l'activation de la dictée devrait arrêter le processus, bien que ce comportement n'ait pas toujours été reproduit de manière fiable ; L'indicateur sur l'écran a averti à l'occasion que le focus de la fenêtre avait été perdu. En revanche, passer à une autre fenêtre avec Alt+Tab n'interrompt pas la dictée : Myna se souvient du champ de texte d'origine et évite que le résultat soit collé au mauvais endroit. Si le système ne détecte aucun son, il l’indique également, puisqu’il ne peut pas retranscrire le silence.
Whisper, modèles locaux et fonction optionnelle
Canonical garantit qu'aucun audio ne quitte l'appareil : Myna ne dépend pas des modèles cloud, il fonctionne entièrement hors ligne et l'audio utilisé pour la transcription n'est stocké, enregistré ou utilisé pour entraîner aucun modèle. Dans les tests actuels, l'outil utilise Chuchotermais le projet prévoit de proposer plusieurs modèles locaux distribués sous forme de snaps, certains conçus pour fonctionner uniquement avec des GPU NVIDIA et d'autres exclusivement sur des CPU, avec un support linguistique différent selon les cas.
L’idée est que lorsque la fonctionnalité sera prête pour des tests plus larges, le système lui-même choisira automatiquement le modèle local le plus approprié en fonction du matériel disponible. Pour l'instant, ni les clichés vocaux de Myna ni l'orchestrateur ne sont publiés sur le Magasin instantané; La seule façon de les tester est de compiler le code disponible sur GitHub.
Jon Seager, vice-président de l'ingénierie chez Canonical, a expliqué qu'utiliser l'intelligence artificielle dans le seul but de l'inclure fonctionne rarement et que toute fonctionnalité fournie avec Ubuntu doit apporter une réelle valeur à ceux qui l'utilisent. Dans cette optique, Myna est conçue comme une fonction opt-in : personne n’aura à l’activer si la dictée vocale ne l’intéresse pas.
L'orchestrateur et les modèles de reconnaissance vocale que vous téléchargez seront distribués sous forme de instantanés, ce qui facilitera leur suppression complète si vous ne souhaitez pas les utiliser. Canonical prévoit également une méthode de saisie native pour Wayland dans une future version.
FAQ Myna Ubuntu 26.10 Non. Selon Canonical, Myna fonctionne complètement hors ligne : aucun audio ne quitte l'appareil ni n'est stocké, enregistré ou utilisé pour entraîner des modèles.
Il s'active en appuyant une fois sur le raccourci Super + T avec le curseur situé dans le champ de texte où l'on souhaite dicter, sans avoir à le maintenir enfoncé.
Dans les tests actuels, il utilise Whisper, bien que Canonical prévoit de proposer plusieurs modèles locaux supplémentaires distribués sous forme de snaps, certains optimisés pour les GPU NVIDIA et d'autres pour les CPU.
Oui. L'orchestrateur et les modèles vocaux sont distribués sous forme de clichés, ce qui les rend faciles à supprimer car la fonctionnalité est conçue comme facultative.
Myna envoie-t-elle de l'audio à des serveurs externes ?
Comment activer la saisie vocale avec Myna ?
Quel modèle d’IA Myna utilise-t-elle pour transcrire ?
Pouvez-vous désinstaller Myna si vous ne souhaitez pas l'utiliser ?