Blogg / Diktere til Claude Code i Windows

Diktere til Claude Code i Windows: hva /voice sender, og en lokal vei

Å snakke med en kodeagent er den første formen for diktering mange utviklere noen gang har ønsket seg. Promptene er lange, muntlige og fulle av ting som «refaktorer auth-middlewaren», og det tar lengre tid å skrive dem enn å si dem. Claude Code har nå fått en talemodus, og den er god. Denne artikkelen forklarer nøyaktig hva den gjør med lyden din og hvor den stopper, og gir målte tall for alternativet: en dikteringstast som virker i alle terminaler, chattefelt og redigeringsprogrammer på maskinen, der talemodellen kjører på din egen GPU.

Hva talemodusen i Claude Code gjør

Du slår den på med /voice. I standardmodusen (hold) holder du inne mellomromstasten mens du snakker; i modusen tap trykker du én gang for å starte og én gang for å sende. Teksten dukker opp i prompten mens du snakker, nedtonet til den er endelig, og du kan blande skriving og tale i samme melding. Opptaket stopper av seg selv etter femten sekunder med stillhet eller to minutter totalt. Transkriberingen er tilpasset ordforrådet i kode, og Claude Code legger i det stille til prosjektnavnet og git-grenen din som gjenkjenningshint, et smart grep. Den teller ikke mot bruksgrensene dine.

Så til det Anthropics egen dokumentasjon slår fast i sitt første krav, ordrett: «Taledikteringen strømmer det innspilte lydopptaket ditt til Anthropics servere for transkribering. Lyden behandles ikke lokalt.» (Voice dictation streams your recorded audio to Anthropic's servers for transcription. Audio is not processed locally.) Tre konsekvenser følger av den setningen, og de står beskrevet på samme side.

  • Den krever en claude.ai-konto. Taletjenesten er ikke tilgjengelig når Claude Code kjører på en API-nøkkel, Amazon Bedrock, Google Clouds Agent Platform eller Microsoft Foundry. Virksomheter som valgte de veiene for å styre hvor dataene deres ligger, får ingen talemodus. Det er konsekvent, om enn upraktisk.
  • Den krever en lokal mikrofon. Ingen tale i SSH-økter, i Claude Code på nettet, i VS Code Remote, Dev Containers eller Codespaces, og heller ikke i WSL1.
  • Den kan tjue språk, ett om gangen. Dikteringen følger innstillingen language og står på engelsk som standard. Setter du den til polsk, dikterer du på polsk; snakker du polsk mens den står på engelsk, blir teksten sludder, som feilsøkingsdelen påpeker. Det finnes ingen automatisk gjenkjenning av språket.

Ingenting av dette er kritikk av ingeniørarbeidet. Det er en beskrivelse av en arkitektur: en svært god transkriberingstjeneste i skyen, bygd inn i én applikasjon og tilgjengelig for én type konto.

Hvor den stopper i en utviklers hverdag

Kravene til konto og nettverk betyr noe for noen og ingenting for andre. To begrensninger rammer alle.

Den virker bare i prompten til Claude Code. I det øyeblikket du bytter til en Codex-økt, en Cursor-chat, en GitHub-sak i nettleseren, en commit-melding i redigeringsprogrammet eller en Slack-tråd, er stemmen borte. Utviklere som snakker med agenter, snakker sjelden med bare én av dem.

Lyden forlater maskinen. For et privat sideprosjekt bryr ingen seg. For kodebasen til en kunde under taushetsavtale, en regulert arbeidsgiver eller rett og slett en utvikler som valgte lokale modeller av en grunn, er det en grense. Noen organisasjoner har allerede slått av funksjonen med en policy, og da melder Claude Code «Voice mode is disabled by your organization's policy».

Det lokale alternativet, målt

En dikteringstast for hele systemet kommer rundt begge begrensningene: trykk på den i et hvilket som helst vindu, snakk, trykk igjen, og teksten havner der markøren sto, transkribert av en Whisper-modell på ditt eget skjermkort. Det åpenbare spørsmålet er om lokal transkribering er rask nok til å føles som en samtale. Vi målte vår egen motor, den som sitter i AlphaDictate, på den bærbare denne artikkelen ble skrevet på. Den har en diskret NVIDIA RTX 5070 Ti-GPU for bærbare og en integrert AMD Radeon 890M. Klippet er 77 sekunder med syntetisk engelsk tale om et produktmøte, kuttet i typiske opptakslengder; hvert tall er medianen av tre kjøringer gjennom motoren slik den leveres, og tar ikke med den brøkdelen av et sekund selve innlimingen tar.

OpptakslengdeRask, diskretBest, diskretRask, integrertBest, integrert
5 sekunder0,13 s0,29 s0,31 s1,2 s
15 sekunder0,30 s0,77 s0,64 s2,0 s
60 sekunder1,6 s3,0 s2,7 s9,3 s

Å laste en modell inn i GPU-en skjer én gang og tok mellom ett og to og et halvt sekund, avhengig av størrelsen. En typisk prompt til en agent er ti til tjue sekunder med tale. På en diskret GPU kommer teksten altså under et sekund etter at du slutter å snakke, selv med den mest nøyaktige modellen, og på en integrert GPU etter omtrent to sekunder, eller godt under et sekund hvis du velger modellen Rask. Diktering i skyen er ikke nevneverdig raskere enn dette når tiden fram og tilbake regnes med, og den lokale blir ikke tregere på en dårlig forbindelse.

Lengre opptak gir sjelden engang så lang ventetid: ved hver pause transkriberer AlphaDictate det du har sagt så langt, mens du snakker videre, så etter et minutt med diktering med pauser gjenstår bare den siste biten. Det tar omtrent et halvt sekund på den diskrete GPU-en og to sekunder på den integrerte med den mest nøyaktige modellen. GPU-artikkelen vår har de tallene.

To ærlige forbehold. Syntetisk tale er renere enn et menneske som mumler inn i mikrofonen på en bærbar, så det denne testen måler, er ventetid, ikke nøyaktighet. Og tallene for integrert GPU gjelder en bærbar fra 2025; eldre integrert grafikk er tregere, og derfor tilbyr appen tre modellstørrelser og forteller deg ved første oppstart hvilken maskinvaren din klarer.

Terminalproblemet ingen nevner

Alle dikteringsverktøy i Windows, også vårt, får tekst inn i en terminal på samme måte: de legger teksten på utklippstavlen og sender en innliming. Windows Terminal, terminalen i VS Code og konsollen Claude Code kjører i, tar alle imot Ctrl+V, så dette virker. To ting ødelegger det, og de ødelegger det for alle verktøy.

Den første er en terminal som kjører som administrator. Kjører du skallet som administrator, forkaster Windows i det stille tastetrykk som sendes inn av et program med vanlige rettigheter, og innlimingen ser ut til ikke å gjøre noe, uten feilmelding noe sted. AlphaDictate sjekker dette før innlimingen og sier fra om at teksten ligger på utklippstavlen, så du kan trykke Ctrl+V selv i stedet for å miste opptaket. Den andre er selve utklippstavlen: innlimingen erstatter det du hadde kopiert. Vi valgte med vilje å la teksten ligge igjen på utklippstavlen, slik at en innliming som mislyktes uansett grunn, bare er én Ctrl+V unna, og hvert opptak lagres også i den lokale historikken i appen. Har du noe verdifullt på utklippstavlen når du dikterer, må du kopiere det på nytt etterpå. Det er avveiningen, og vi sier det heller her enn at du oppdager det selv.

Slik setter du opp en lokal dikteringstast for arbeid med agenter

  1. Installer en lokal dikteringsapp, og la den laste ned en modell. Velg Rask hvis du har integrert grafikk og vil ha resultater på under et sekund; velg Best på en diskret GPU.
  2. Legg den på noe du treffer uten å se. En sideknapp på musen er ideell for arbeid med agenter: hånden på musen, trykk, snakk, trykk, og prompten fylles ut.
  3. La språket stå på automatisk gjenkjenning hvis du tenker på mer enn ett språk. Whisper henger med når du bytter midt i en setning.
  4. Legg inn de rare ordene i prosjektet ditt i ordforrådshintet én gang: navnene på interne tjenester, biblioteket du stadig nevner, etternavnet til medgründeren din.
  5. Behold gjerne talemodusen i Claude Code også, hvis du liker at teksten skrives fortløpende mens du snakker. De to kommer ikke i konflikt; den ene er en tast i én app, den andre en tast overalt.

Vi lager AlphaDictate, så les anbefalingen med det i bakhodet, og merk at det gratis alternativet i samme kategori er Handy, en lokal dikteringsapp med åpen kildekode, færre funksjoner og ingen kostnad. Den tidligere artikkelen vår om taleinntasting i Windows tar for seg det innebygde alternativet, som også sender lyden til en server og også bare håndterer ett språk om gangen.


Ofte spurt

Behandler talemodusen i Claude Code lyden lokalt? Nei. Anthropics dokumentasjon sier at lyden strømmes til Anthropics servere for transkribering og ikke behandles lokalt.

Hvorfor sier /voice at den krever en Claude.ai-konto? Tale-til-tekst-tjenesten tilbys bare til innlogginger på claude.ai. Claude Code-økter som er autentisert med en API-nøkkel, Bedrock, Google Clouds Agent Platform eller Microsoft Foundry, kan ikke bruke den.

Kan jeg diktere til Claude Code over SSH? Ikke med den innebygde talemodusen, som krever en lokal mikrofon. En dikteringsapp for hele systemet som kjører på din lokale maskin, skriver inn i SSH-terminalen akkurat som i et hvilket som helst annet vindu.

Hvilke språk støtter talemodusen i Claude Code? Tjue, blant dem engelsk, tysk, fransk, spansk, portugisisk, polsk, japansk, koreansk og ukrainsk. Språket velges med språkinnstillingen og gjenkjennes ikke automatisk.

Hvor rask er lokal diktering på en bærbar? På den bærbare vi målte, ble et opptak på femten sekunder transkribert på under et sekund på den diskrete GPU-en med den mest nøyaktige modellen, og på omtrent to sekunder på den integrerte GPU-en, eller på under et sekund med modellen Rask.

Virker diktering i en terminal som kjører som administrator? I Windows ignorerer vinduer som kjører som administrator, innliminger som sendes inn fra andre programmer, uansett verktøy. AlphaDictate oppdager dette og lar teksten ligge på utklippstavlen, så du kan trykke Ctrl+V selv.

Denne artikkelen er maskinoversatt fra engelsk og gjennomgått for mening, ikke av en norsk korrekturleser. Den engelske versjonen er fasiten.