Claude Code i Windows: vad /voice skickar, och hur du dikterar lokalt
För många utvecklare är en kodagent det första de någonsin velat diktera till. Promptarna är långa, pratiga och fulla av fraser som "refaktorera auth-middlewaren", och det går långsammare att skriva dem än att säga dem. Claude Code har nu ett röstläge, och det är bra. Den här artikeln förklarar exakt vad det gör med ditt ljud och var det tar stopp, och ger uppmätta siffror för alternativet: en dikteringstangent som fungerar i varje terminal, chattruta och editor på datorn, med talmodellen på din egen GPU.
Vad Claude Codes röstläge gör
Du slår på det med /voice. I standardläget, hold, håller du ned blankstegstangenten medan du talar; i läget tap trycker du en gång för att börja och en gång för att skicka. Texten dyker upp i prompten medan du talar, nedtonad tills den är slutgiltig, och du kan blanda skrivet och talat i samma meddelande. Inspelningen stoppar av sig själv efter femton sekunders tystnad eller två minuter totalt. Transkriberingen är anpassad för kodordförråd, och Claude Code lägger i det tysta till projektnamnet och git-grenen som ledtrådar för igenkänningen, vilket är ett smart grepp. Det räknas inte mot dina användningsgränser.
Så till det som Anthropics egen dokumentation anger som sitt allra första krav, ordagrant: "Röstdiktering strömmar ditt inspelade ljud till Anthropics servrar för transkribering. Ljudet behandlas inte lokalt." ("Voice dictation streams your recorded audio to Anthropic's servers for transcription. Audio is not processed locally.") Tre konsekvenser följer av den meningen, och de står utskrivna på samma sida.
- Det kräver ett claude.ai-konto. Taltjänsten är inte tillgänglig när Claude Code körs med en API-nyckel, Amazon Bedrock, Google Clouds Agent Platform eller Microsoft Foundry. Företagsmiljöer som valt de vägarna för att styra var deras data hamnar får inget röstläge, vilket är konsekvent, om än opraktiskt.
- Det kräver en lokal mikrofon. Ingen röst i SSH-sessioner, i Claude Code på webben, i VS Code Remote, Dev Containers eller Codespaces, och inte heller i WSL1.
- Det kan tjugo språk, ett i taget. Dikteringen följer inställningen
languageoch är på engelska som standard. Ställ in den på polska så dikterar du på polska; pratar du polska medan den står på engelska blir texten rena sörjan, som felsökningsavsnittet påpekar. Det finns ingen automatisk språkidentifiering.
Inget av det är kritik mot ingenjörsarbetet. Det är en beskrivning av en arkitektur: en mycket bra transkriberingstjänst i molnet, inbyggd i ett enda program och tillgänglig för en enda sorts konto.
Var det tar stopp i vardagen som utvecklare
Villkoren för konto och nätverk spelar roll för vissa och inte för andra. Två begränsningar drabbar alla.
Det fungerar bara i Claude Codes prompt. I samma stund som du byter till en Codex-session, en Cursor-chatt, ett GitHub-ärende i webbläsaren, ett commit-meddelande i editorn eller en Slack-tråd är rösten borta. Utvecklare som pratar med agenter pratar sällan med bara en av dem.
Ljudet lämnar datorn. För ett personligt sidoprojekt bekymrar det ingen. För en kunds kodbas under sekretessavtal, en arbetsgivare i en reglerad bransch eller helt enkelt en utvecklare som valt lokala modeller av en anledning är det en gräns. Vissa organisationer har redan stängt av funktionen med en policy, vilket Claude Code meddelar med "Voice mode is disabled by your organization's policy".
Det lokala alternativet, uppmätt
En dikteringstangent för hela systemet kringgår båda begränsningarna: tryck på den i vilket fönster som helst, tala, tryck igen, och texten hamnar där markören stod, transkriberad av en Whisper-modell på ditt eget grafikkort. Den självklara frågan är om lokal transkribering går tillräckligt fort för att kännas som ett samtal. Vi mätte vår egen motor, den som finns i AlphaDictate, på den bärbara dator som den här artikeln skrevs på. Den har ett diskret NVIDIA RTX 5070 Ti-grafikkort för bärbara datorer och en integrerad AMD Radeon 890M. Klippet är 77 sekunder syntetiskt engelskt tal om ett produktmöte, uppdelat i typiska längder för en tagning; varje siffra är medianen av tre körningar genom motorn som appen levereras med, och bråkdelen av en sekund som själva inklistringen tar är inte medräknad.
| Tagningens längd | Snabb, diskret GPU | Bäst, diskret GPU | Snabb, integrerad GPU | Bäst, integrerad GPU |
|---|---|---|---|---|
| 5 sekunder | 0,13 s | 0,29 s | 0,31 s | 1,2 s |
| 15 sekunder | 0,30 s | 0,77 s | 0,64 s | 2,0 s |
| 60 sekunder | 1,6 s | 3,0 s | 2,7 s | 9,3 s |
Modellen läses in i GPU:n en gång, och det tog mellan en och två och en halv sekund beroende på storlek. En typisk prompt till en agent är tio till tjugo sekunder tal, så med den mest träffsäkra modellen dyker texten upp mindre än en sekund efter att du slutat prata på en diskret GPU, och efter ungefär två sekunder på en integrerad GPU, eller på klart under en sekund om du väljer modellen Snabb. Molndiktering är inte nämnvärt snabbare än så när man räknar in vägen fram och tillbaka, och lokal diktering blir inte långsammare av en dålig uppkoppling.
Längre tagningar behöver sällan vänta ens så länge: AlphaDictate transkriberar det du sagt vid varje paus medan du fortsätter prata, så efter en minuts diktering med pauser återstår bara den sista biten, ungefär en halv sekund på den diskreta GPU:n och två sekunder på den integrerade, med den mest träffsäkra modellen. Siffrorna finns i vår artikel om grafikkort.
Två ärliga förbehåll. Syntetiskt tal är renare än en människa som mumlar mot mikrofonen i en bärbar dator, så testet mäter inte träffsäkerhet utan fördröjning. Och kolumnerna för integrerad GPU gäller en bärbar dator från 2025; äldre integrerad grafik är långsammare, och det är därför appen erbjuder tre modellstorlekar och vid första starten talar om vilken din hårdvara klarar.
Terminalproblemet som ingen nämner
Alla dikteringsverktyg i Windows, vårt inräknat, får in text i en terminal på samma sätt: de lägger texten i urklipp och skickar en inklistring. Windows Terminal, terminalen i VS Code och konsolen som Claude Code körs i tar alla emot Ctrl+V, så det fungerar. Två saker sätter det ur spel, och de gör det för alla verktyg.
Den första är en terminal med förhöjd behörighet. Kör du skalet som administratör kastar Windows i tysthet tangenttryckningar som skickas från ett program med vanlig behörighet, och inklistringen verkar inte göra någonting, utan felmeddelande någonstans. AlphaDictate kontrollerar det innan den klistrar in och talar om att texten ligger i urklipp så att du kan trycka Ctrl+V själv, i stället för att tagningen går förlorad. Den andra är själva urklippet: texten ersätter det du hade kopierat. Vi har medvetet valt att låta texten ligga kvar i urklipp, så att en inklistring som misslyckats av vilken anledning som helst bara är ett Ctrl+V bort, och varje tagning sparas dessutom i appens lokala historik. Dikterar du mitt i att du kopierar något värdefullt, kopiera det igen efteråt. Det är avvägningen, och vi säger det hellre här än låter dig upptäcka det själv.
Så ställer du in en lokal dikteringstangent för arbete med agenter
- Installera en lokal dikteringsapp och låt den ladda ner en modell. Välj Snabb om du har integrerad grafik och vill ha resultat på under en sekund; välj Bäst på en diskret GPU.
- Lägg den på något du når utan att titta. En sidoknapp på musen är perfekt för arbete med agenter: handen på musen, tryck, tala, tryck, och prompten fylls i.
- Låt språket stå på Identifiera automatiskt om du tänker på mer än ett språk. Whisper hänger med dig mitt i en mening.
- Skriv in projektets udda ord i Ordtips en gång: namn på interna tjänster, biblioteket du ständigt nämner, din medgrundares efternamn.
- Låt gärna Claude Codes eget röstläge vara på också om du gillar att se texten växa fram medan du talar. De krockar inte; det ena är en tangent i ett enda program, det andra en tangent överallt.
Vi gör AlphaDictate, så läs rekommendationen med det i åtanke, och notera att det kostnadsfria alternativet i samma kategori är Handy, en lokal dikteringsapp med öppen källkod, färre funktioner och ingen prislapp. Vår tidigare artikel om röstinmatning i Windows tar upp det inbyggda alternativet, som också skickar ljudet till en server och också bara klarar ett språk i taget.
Vanliga frågor
Behandlar Claude Codes röstläge ljudet lokalt? Nej. Enligt Anthropics dokumentation strömmas ljudet till Anthropics servrar för transkribering och behandlas inte lokalt.
Varför säger /voice att det kräver ett Claude.ai-konto? Tjänsten för tal till text erbjuds bara till den som är inloggad med claude.ai. Claude Code-sessioner som autentiseras med en API-nyckel, Bedrock, Google Clouds Agent Platform eller Microsoft Foundry kan inte använda den.
Kan jag diktera till Claude Code över SSH? Inte med det inbyggda röstläget, som kräver en lokal mikrofon. En dikteringsapp för hela systemet som körs på din lokala dator skriver i SSH-terminalen precis som i vilket annat fönster som helst.
Vilka språk stöder Claude Codes röstläge? Tjugo, bland annat engelska, tyska, franska, spanska, portugisiska, polska, japanska, koreanska och ukrainska. Språket väljs med språkinställningen i stället för att identifieras automatiskt.
Hur snabb är lokal diktering på en bärbar dator? På den bärbara dator vi mätte transkriberades en tagning på femton sekunder på under en sekund på den diskreta GPU:n med den mest träffsäkra modellen, och på ungefär två sekunder på den integrerade GPU:n, eller på under en sekund med modellen Snabb.
Fungerar diktering i en terminal som körs som administratör? I Windows ignorerar fönster med förhöjd behörighet inklistringar som skickas från andra program, oavsett verktyg. AlphaDictate upptäcker det och lämnar texten i urklipp så att du kan trycka Ctrl+V själv.
Den här artikeln är maskinöversatt från engelska och kontrollerad för innehåll, men inte av en modersmålstalare. Den engelska versionen gäller.