Blog / Claude Code sous Windows

Claude Code sous Windows : ce qu'envoie /voice, et la dictée locale

Parler à un agent de code est la première forme de dictée dont beaucoup de développeurs aient jamais eu envie. Les prompts sont longs, conversationnels et remplis de phrases comme « refactorise le middleware d'auth », et les taper prend plus de temps que les dire. Claude Code intègre désormais un mode vocal, et il est bon. Cet article explique précisément ce qu'il fait de votre audio et où il s'arrête, puis donne des chiffres mesurés pour l'alternative : une touche de dictée qui fonctionne dans chaque terminal, chaque zone de chat et chaque éditeur de la machine, avec un modèle de reconnaissance vocale qui tourne sur votre propre GPU.

Ce que fait le mode vocal de Claude Code

Vous l'activez avec /voice. Dans le mode par défaut, hold, vous maintenez la barre d'espace enfoncée pendant que vous parlez ; en mode tap, vous appuyez une fois pour commencer et une fois pour envoyer. La transcription s'affiche dans le prompt au fil de vos paroles, grisée tant qu'elle n'est pas définitive, et vous pouvez mêler clavier et parole dans le même message. L'enregistrement s'arrête de lui-même après quinze secondes de silence ou deux minutes au total. La transcription est optimisée pour le vocabulaire du code, et Claude Code ajoute discrètement le nom de votre projet et votre branche git comme indices de reconnaissance, ce qui est bien vu. Rien n'est décompté de vos limites d'utilisation.

Vient maintenant ce que la documentation d'Anthropic elle-même énonce dans sa première exigence, mot pour mot : « La dictée vocale transmet en continu votre audio enregistré aux serveurs d'Anthropic pour la transcription. L'audio n'est pas traité localement. » (Voice dictation streams your recorded audio to Anthropic's servers for transcription. Audio is not processed locally.) Trois conséquences découlent de cette phrase, et la même page les détaille.

  • Il faut un compte claude.ai. Le service vocal n'est pas disponible quand Claude Code fonctionne avec une clé API, Amazon Bedrock, l'Agent Platform de Google Cloud ou Microsoft Foundry. Les entreprises qui ont choisi ces voies pour des raisons de résidence des données n'ont pas de mode vocal, ce qui est cohérent, à défaut d'être pratique.
  • Il faut un microphone local. Pas de voix dans les sessions SSH, dans Claude Code sur le web, dans VS Code Remote, Dev Containers ou Codespaces, ni dans WSL1.
  • Il parle vingt langues, une à la fois. La dictée suit le réglage language et utilise l'anglais par défaut. Réglez-le sur le polonais et vous dictez en polonais ; parlez polonais alors qu'il est réglé sur l'anglais et la transcription n'a plus aucun sens, comme le signale la section de dépannage. Il n'y a pas de détection automatique.

Rien de tout cela n'est une critique de l'ingénierie. C'est la description d'une architecture : un très bon service de transcription dans le cloud, intégré à une seule application, réservé à un seul type de compte.

Où il s'arrête pour un développeur au quotidien

Les conditions de compte et de réseau comptent pour certains et pas pour d'autres. Deux limites touchent tout le monde.

Il ne fonctionne que dans le prompt de Claude Code. Dès que vous passez à une session Codex, à un chat Cursor, à une issue GitHub dans le navigateur, à un message de commit dans votre éditeur ou à un fil Slack, la voix disparaît. Les développeurs qui parlent à des agents parlent rarement à un seul.

L'audio quitte la machine. Pour un projet personnel, cela n'inquiète personne. Pour le code d'un client sous accord de confidentialité, pour un employeur soumis à une réglementation, ou simplement pour un développeur qui a choisi des modèles locaux pour une bonne raison, c'est une ligne rouge. Certaines organisations ont déjà désactivé la fonction par stratégie, ce que Claude Code signale par le message « Voice mode is disabled by your organization's policy ».

L'alternative locale, mesurée

Une touche de dictée valable dans tout le système contourne ces deux limites : appuyez dessus dans n'importe quelle fenêtre, parlez, appuyez à nouveau, et le texte arrive là où était le curseur, transcrit par un modèle Whisper sur votre propre carte graphique. La question évidente est de savoir si la transcription locale est assez rapide pour donner l'impression d'une conversation. Nous avons mesuré notre propre moteur, celui d'AlphaDictate, sur le portable sur lequel cet article a été écrit, équipé d'un GPU dédié NVIDIA RTX 5070 Ti pour portable et d'un GPU intégré AMD Radeon 890M. L'extrait compte 77 secondes de parole anglaise synthétique à propos d'une réunion produit, découpées aux durées de prise habituelles ; chaque chiffre est la médiane de trois passages dans le moteur tel qu'il est livré, sans la fraction de seconde que prend le collage lui-même.

Durée de la priseRapide, GPU dédiéMeilleur, GPU dédiéRapide, GPU intégréMeilleur, GPU intégré
5 secondes0,13 s0,29 s0,31 s1,2 s
15 secondes0,30 s0,77 s0,64 s2,0 s
60 secondes1,6 s3,0 s2,7 s9,3 s

Le chargement d'un modèle dans le GPU n'a lieu qu'une fois et a pris entre une et deux secondes et demie selon sa taille. Un prompt typique adressé à un agent représente dix à vingt secondes de parole : sur un GPU dédié, le texte apparaît donc moins d'une seconde après que vous avez fini de parler, avec le modèle le plus précis, et sur un GPU intégré en deux secondes environ, ou bien moins d'une seconde si vous choisissez le modèle Rapide. La dictée dans le cloud n'est pas sensiblement plus rapide une fois l'aller-retour compté, et la dictée locale, elle, ne ralentit pas quand la connexion est mauvaise.

Les prises plus longues attendent rarement autant : AlphaDictate transcrit ce que vous avez dit à chaque pause pendant que vous continuez à parler, si bien qu'après une minute de dictée ponctuée de pauses, il ne reste que le dernier passage, soit environ une demi-seconde sur le GPU dédié et deux secondes sur le GPU intégré avec le modèle le plus précis. Notre article sur les GPU donne ces chiffres.

Deux réserves, en toute honnêteté. La parole synthétique est plus nette qu'un humain qui marmonne devant le micro d'un portable : ce test ne mesure donc pas la précision, mais la latence. Et la colonne du GPU intégré correspond à un portable de 2025 ; une puce graphique intégrée plus ancienne sera plus lente, c'est pourquoi l'application propose trois tailles de modèle et vous indique au premier lancement laquelle votre matériel prend en charge.

Le problème du terminal dont personne ne parle

Sous Windows, tous les outils de dictée, le nôtre compris, font entrer le texte dans un terminal de la même façon : ils placent la transcription dans le presse-papiers et envoient un collage. Windows Terminal, le terminal de VS Code et la console dans laquelle tourne Claude Code acceptent tous Ctrl+V, donc cela fonctionne. Deux choses le font échouer, et pour tous les outils.

La première, c'est un terminal lancé en tant qu'administrateur. Si vous exécutez votre shell avec des droits d'administrateur, Windows ignore sans rien dire les frappes injectées par un programme aux privilèges normaux, et le collage semble ne rien faire, sans la moindre erreur nulle part. AlphaDictate vérifie ce cas avant de coller et vous indique que le texte est dans le presse-papiers pour que vous appuyiez vous-même sur Ctrl+V, plutôt que de perdre la prise. La seconde, c'est le presse-papiers lui-même : le collage remplace ce que vous aviez copié. Nous avons choisi délibérément de laisser la transcription dans le presse-papiers, pour qu'un collage qui a échoué pour une raison quelconque ne soit qu'à un Ctrl+V de distance, et chaque prise est aussi conservée dans l'historique local de l'application. Si vous dictez au beau milieu d'un copier-coller précieux, copiez à nouveau ensuite. C'est le compromis, et nous préférons l'écrire ici plutôt que de vous le laisser découvrir.

Configurer une touche de dictée locale pour travailler avec des agents

  1. Installez une application de dictée locale et laissez-la télécharger un modèle. Choisissez le modèle Rapide si vous avez une puce graphique intégrée et voulez des résultats en moins d'une seconde ; choisissez Meilleur sur un GPU dédié.
  2. Associez-la à quelque chose que vous atteignez sans regarder. Un bouton latéral de la souris est idéal pour travailler avec des agents : la main sur la souris, vous appuyez, vous parlez, vous appuyez, le prompt se remplit.
  3. Laissez la langue en détection automatique si vous pensez dans plus d'une langue. Whisper vous suivra en pleine phrase.
  4. Ajoutez une fois pour toutes les mots insolites de votre projet à l'indice de vocabulaire : noms de services internes, la bibliothèque que vous citez sans arrêt, le nom de famille de votre cofondateur.
  5. Gardez aussi le mode vocal de Claude Code activé si vous aimez son aperçu de saisie en direct. Les deux ne se gênent pas : l'un est une touche dans une seule application, l'autre une touche partout.

Nous fabriquons AlphaDictate : lisez cette recommandation en gardant cela en tête, et sachez que l'alternative gratuite de la même catégorie est Handy, une application de dictée locale libre, moins complète et sans frais. Notre précédent article sur la saisie vocale de Windows présente l'option intégrée, qui envoie elle aussi l'audio à un serveur et s'arrête elle aussi à une seule langue.


Questions fréquentes

Le mode vocal de Claude Code traite-t-il l'audio localement ? Non. La documentation d'Anthropic indique que l'audio est transmis en continu aux serveurs d'Anthropic pour la transcription et qu'il n'est pas traité localement.

Pourquoi /voice indique-t-il qu'il faut un compte Claude.ai ? Le service de transcription vocale n'est proposé qu'aux connexions claude.ai. Les sessions Claude Code authentifiées avec une clé API, Bedrock, l'Agent Platform de Google Cloud ou Microsoft Foundry ne peuvent pas l'utiliser.

Puis-je dicter à Claude Code via SSH ? Pas avec le mode vocal intégré, qui a besoin d'un microphone local. Une application de dictée valable dans tout le système, installée sur votre machine locale, tape dans le terminal SSH comme dans n'importe quelle autre fenêtre.

Quelles langues le mode vocal de Claude Code prend-il en charge ? Vingt, dont l'anglais, l'allemand, le français, l'espagnol, le portugais, le polonais, le japonais, le coréen et l'ukrainien, choisies par le réglage de langue plutôt que détectées.

Quelle est la vitesse de la dictée locale sur un portable ? Sur le portable que nous avons mesuré, une prise de quinze secondes a été transcrite en moins d'une seconde sur le GPU dédié avec le modèle le plus précis, et en deux secondes environ sur le GPU intégré, ou en moins d'une seconde avec le modèle Rapide.

La dictée fonctionne-t-elle dans un terminal administrateur ? Sous Windows, les fenêtres lancées en tant qu'administrateur ignorent les collages injectés, quel que soit l'outil. AlphaDictate le détecte et laisse le texte dans le presse-papiers pour un Ctrl+V manuel.

Cet article a été traduit de l'anglais par une machine, puis relu pour le sens, mais pas par un relecteur natif. La version anglaise fait foi.