Dicteren in Claude Code op Windows: /voice via de cloud, of lokaal
Praten tegen een programmeeragent is voor veel ontwikkelaars de eerste vorm van dicteren die ze ooit echt wilden. Prompts zijn lang, klinken als een gesprek en zitten vol woorden als "refactor de auth-middleware", en ze typen gaat langzamer dan ze uitspreken. Claude Code heeft nu een spraakmodus, en die is goed. Dit artikel legt precies uit wat hij met je audio doet en waar hij ophoudt, en geeft gemeten cijfers voor het alternatief: een dicteertoets die werkt in elke terminal, elk chatvenster en elke editor op je computer, met het spraakmodel op je eigen GPU.
Wat de spraakmodus van Claude Code doet
Je zet hem aan met /voice. In de standaard hold-modus houd je de spatiebalk ingedrukt terwijl je praat; in de tap-modus tik je één keer om te beginnen en één keer om te verzenden. De transcriptie verschijnt al pratend in de prompt, gedimd tot hij definitief is, en je kunt typen en spreken in hetzelfde bericht combineren. De opname stopt vanzelf na vijftien seconden stilte of na twee minuten in totaal. De transcriptie is afgestemd op programmeerjargon, en Claude Code geeft ongemerkt de naam van je project en je git-branch mee als hint voor de herkenning, een slimme vondst. Het telt niet mee voor je gebruikslimieten.
Dan het deel dat de eigen documentatie van Anthropic als eerste vereiste noemt: "Spraakdicteren streamt je opgenomen audio voor transcriptie naar de servers van Anthropic. Audio wordt niet lokaal verwerkt." (letterlijk: "Voice dictation streams your recorded audio to Anthropic's servers for transcription. Audio is not processed locally.") Uit die zin volgen drie dingen, en ze staan op dezelfde pagina uitgeschreven.
- Je hebt een claude.ai-account nodig. De spraakdienst is niet beschikbaar als Claude Code draait via een API-sleutel, Amazon Bedrock, het Agent Platform van Google Cloud of Microsoft Foundry. Zakelijke omgevingen die om redenen van dataresidentie voor die routes kozen, krijgen geen spraakmodus. Dat is consequent, al is het onhandig.
- Je hebt een lokale microfoon nodig. Geen spraak in SSH-sessies, in Claude Code op het web, in VS Code Remote, Dev Containers of Codespaces, en niet in WSL1.
- Hij spreekt twintig talen, één tegelijk. Het dicteren volgt de instelling
languageen staat standaard op Engels. Zet die op Pools en je dicteert in het Pools; spreek Pools terwijl hij op Engels staat en de transcriptie is onzin, zoals de sectie over probleemoplossing opmerkt. Automatische taalherkenning is er niet.
Niets hiervan is kritiek op de techniek. Het is een beschrijving van een architectuur: een heel goede transcriptiedienst in de cloud, ingebouwd in één applicatie, beschikbaar voor één soort account.
Waar het ophoudt in het dagelijkse ontwikkelwerk
De voorwaarden rond account en netwerk doen er voor sommigen toe en voor anderen niet. Twee beperkingen treffen iedereen.
Het werkt alleen in de prompt van Claude Code. Zodra je overschakelt naar een Codex-sessie, een chat in Cursor, een GitHub-issue in de browser, een commitbericht in je editor of een Slack-thread, is de spraak weg. Ontwikkelaars die met agents praten, praten zelden met maar één.
De audio verlaat je computer. Bij een eigen hobbyproject maakt niemand zich daar zorgen over. Bij de codebase van een klant onder NDA, een werkgever in een gereguleerde sector, of gewoon een ontwikkelaar die met reden voor lokale modellen koos, is het een grens. Sommige organisaties hebben de functie al via beleid uitgeschakeld; Claude Code meldt dan "Voice mode is disabled by your organization's policy".
Het lokale alternatief, gemeten
Een dicteertoets die in het hele systeem werkt, omzeilt beide beperkingen: druk erop in welk venster ook, praat, druk nog eens, en de tekst komt terecht waar je cursor stond, getranscribeerd door een Whisper-model op je eigen grafische kaart. De voor de hand liggende vraag is of lokale transcriptie snel genoeg is om als een gesprek te voelen. We hebben onze eigen engine gemeten, die in AlphaDictate, op de laptop waarop dit artikel is geschreven. Die heeft een losse NVIDIA RTX 5070 Ti laptop-GPU en een geïntegreerde AMD Radeon 890M. Het fragment is 77 seconden gesynthetiseerde Engelse spraak over een productoverleg, in stukken gesneden van een gangbare opnameduur; elk getal is de mediaan van drie runs door de engine zoals we die uitleveren, zonder de fractie van een seconde die het plakken zelf kost.
| Opnameduur | Snel, losse GPU | Beste, losse GPU | Snel, geïntegreerd | Beste, geïntegreerd |
|---|---|---|---|---|
| 5 seconden | 0,13 s | 0,29 s | 0,31 s | 1,2 s |
| 15 seconden | 0,30 s | 0,77 s | 0,64 s | 2,0 s |
| 60 seconden | 1,6 s | 3,0 s | 2,7 s | 9,3 s |
Een model in de GPU laden gebeurt één keer en duurde één tot tweeënhalve seconde, afhankelijk van de grootte. Een typische prompt aan een agent is tien tot twintig seconden spraak. Op een losse GPU staat de tekst er dus met het nauwkeurigste model binnen een seconde nadat je bent gestopt met praten, en op een geïntegreerde GPU in ongeveer twee seconden, of ruim binnen een seconde als je het model Snel kiest. Dicteren via de cloud is niet merkbaar sneller zodra je de heen-en-terugreis meetelt, en lokaal wordt het niet trager bij een slechte verbinding.
Langere opnames wachten zelden zelfs zo lang: AlphaDictate transcribeert bij elke pauze wat je tot dan toe zei, terwijl jij doorpraat. Na een minuut dicteren met pauzes blijft dus alleen het laatste stuk over: met het nauwkeurigste model ongeveer een halve seconde op de losse GPU en twee seconden op de geïntegreerde. Ons artikel over GPU's heeft die cijfers.
Twee eerlijke kanttekeningen. Gesynthetiseerde spraak is schoner dan een mens die tegen een laptopmicrofoon mompelt, dus deze test meet niet de nauwkeurigheid, maar de wachttijd. En de kolommen met de geïntegreerde GPU zijn een laptop uit 2025; oudere geïntegreerde graphics zijn trager. Daarom biedt de app drie modelgroottes en vertelt hij je bij de eerste start welke je hardware aankan.
Het terminalprobleem dat niemand noemt
Elke dicteertool op Windows, de onze ook, krijgt tekst op dezelfde manier in een terminal: hij zet de transcriptie op het klembord en stuurt een plakopdracht. Windows Terminal, de terminal van VS Code en de console waarin Claude Code draait, accepteren allemaal Ctrl+V, dus dit werkt. Twee dingen gooien roet in het eten, en dat geldt voor elke tool.
Het eerste is een terminal met verhoogde rechten. Draai je je shell als administrator, dan gooit Windows stilletjes de toetsaanslagen weg die een programma met normale rechten verstuurt. Het plakken lijkt dan niets te doen, zonder foutmelding waar dan ook. AlphaDictate controleert dit vóór het plakken en laat je weten dat de tekst op het klembord staat, zodat je zelf op Ctrl+V kunt drukken en de opname niet verloren gaat. Het tweede is het klembord zelf: plakken overschrijft wat je had gekopieerd. We laten de transcriptie bewust op het klembord staan, zodat een plakactie die om welke reden ook mislukte maar één Ctrl+V verwijderd is, en elke opname wordt ook in de lokale geschiedenis van de app bewaard. Dicteer je midden in het kopiëren van iets waardevols, kopieer het daarna dan opnieuw. Dat is de afweging, en we zeggen het liever hier dan dat je er zelf achter komt.
Een lokale dicteertoets instellen voor werk met agents
- Installeer een lokale dicteerapp en laat hem een model downloaden. Kies het model Snel als je geïntegreerde graphics hebt en resultaten binnen een seconde wilt; kies Beste op een losse GPU.
- Leg hem op iets wat je zonder te kijken kunt raken. Een zijknop van de muis is ideaal voor werk met agents: hand op de muis, drukken, praten, drukken, en de prompt vult zich.
- Laat de taal op Automatisch herkennen staan als je in meer dan één taal denkt. Whisper volgt je midden in een zin.
- Zet de ongewone woorden van je project één keer in de woordenhint: namen van interne services, de library die je steeds noemt, de achternaam van je medeoprichter.
- Laat de eigen spraakmodus van Claude Code gerust ook aanstaan als je het live meetypen prettig vindt. De twee zitten elkaar niet in de weg; de een is een toets binnen één app, de ander een toets overal.
Wij maken AlphaDictate, dus lees de aanbeveling met dat in je achterhoofd. Het gratis alternatief in dezelfde categorie is Handy, een open-source lokale dicteerapp met minder functies die niets kost. Ons eerdere stuk over typen via stem in Windows behandelt de ingebouwde optie, die ook audio naar een server stuurt en ook bij één taal ophoudt.
Veelgestelde vragen
Verwerkt de spraakmodus van Claude Code audio lokaal? Nee. Volgens de documentatie van Anthropic wordt de audio voor transcriptie naar de servers van Anthropic gestreamd en niet lokaal verwerkt.
Waarom zegt /voice dat het een Claude.ai-account nodig heeft? De spraak-naar-tekstdienst is alleen beschikbaar voor wie met claude.ai inlogt. Sessies van Claude Code die zijn aangemeld met een API-sleutel, Bedrock, het Agent Platform van Google Cloud of Microsoft Foundry kunnen hem niet gebruiken.
Kan ik via SSH dicteren in Claude Code? Niet met de ingebouwde spraakmodus, want die heeft een lokale microfoon nodig. Een dicteerapp voor het hele systeem die op je eigen computer draait, typt in de SSH-terminal zoals in elk ander venster.
Welke talen ondersteunt de spraakmodus van Claude Code? Twintig, waaronder Engels, Duits, Frans, Spaans, Portugees, Pools, Japans, Koreaans en Oekraïens. Je kiest de taal met de instelling language; hij wordt niet automatisch herkend.
Hoe snel is lokaal dicteren op een laptop? Op de laptop die we maten, was een opname van vijftien seconden met het nauwkeurigste model in minder dan een seconde getranscribeerd op de losse GPU, en in ongeveer twee seconden op de geïntegreerde GPU, of in minder dan een seconde met het model Snel.
Werkt dicteren in een terminal die als administrator draait? Op Windows negeren vensters met verhoogde rechten plakopdrachten die een ander programma verstuurt, bij elke tool. AlphaDictate merkt dat op en laat de tekst op het klembord staan, zodat je hem zelf met Ctrl+V plakt.
Dit artikel is machinaal uit het Engels vertaald en op begrijpelijkheid nagekeken, niet door een moedertaalspreker. De Engelse versie is leidend.