Claude Code w Windows: co wysyła /voice i jak dyktować lokalnie
Rozmowa z agentem programistycznym to dla wielu programistów pierwszy rodzaj dyktowania, jakiego w ogóle kiedykolwiek chcieli. Prompty są długie, pisane jak w rozmowie i pełne zwrotów w rodzaju „zrefaktoruj middleware autoryzacji”, a ich wpisywanie trwa dłużej niż wypowiedzenie. Claude Code ma teraz tryb głosowy i jest on dobry. Ten artykuł wyjaśnia dokładnie, co tryb głosowy robi z Twoim dźwiękiem i gdzie się kończy, a do tego podaje zmierzone liczby dla alternatywy: klawisza dyktowania, który działa w każdym terminalu, oknie czatu i edytorze na komputerze, z modelem mowy uruchomionym na Twoim własnym GPU.
Co robi tryb głosowy Claude Code
Włączasz go poleceniem /voice. W domyślnym trybie hold przytrzymujesz spację, gdy mówisz; w trybie tap naciskasz klawisz raz, żeby zacząć, i drugi raz, żeby wysłać. Transkrypcja pojawia się w polu promptu na bieżąco, przyciemniona, dopóki nie jest ostateczna, a w jednej wiadomości możesz mieszać pisanie z mówieniem. Nagrywanie kończy się samo po piętnastu sekundach ciszy albo po dwóch minutach łącznie. Rozpoznawanie jest dostrojone do słownictwa programistycznego, a Claude Code po cichu dodaje nazwę projektu i gałęzi git jako podpowiedzi dla rozpoznawania — sprytny detal. Nie uszczupla też Twoich limitów użycia.
A teraz część, którą dokumentacja samego Anthropic podaje jako pierwsze wymaganie, słowo w słowo: „Dyktowanie głosowe przesyła nagrany dźwięk na serwery Anthropic w celu transkrypcji. Dźwięk nie jest przetwarzany lokalnie” (Voice dictation streams your recorded audio to Anthropic's servers for transcription. Audio is not processed locally.). Z tego zdania wynikają trzy konsekwencje, opisane na tej samej stronie.
- Wymaga konta claude.ai. Usługa rozpoznawania mowy nie jest dostępna, gdy Claude Code działa na kluczu API, przez Amazon Bedrock, Agent Platform w Google Cloud albo Microsoft Foundry. Firmy, które wybrały te drogi ze względu na lokalizację danych, nie dostają trybu głosowego — co jest konsekwentne, choć niewygodne.
- Wymaga lokalnego mikrofonu. Głosu nie ma w sesjach SSH, w Claude Code w wersji webowej, w VS Code Remote, Dev Containers ani Codespaces, ani w WSL1.
- Mówi w dwudziestu językach, ale w jednym naraz. Dyktowanie idzie za ustawieniem
languagei domyślnie jest to angielski. Ustawisz polski — dyktujesz po polsku; mówisz po polsku przy ustawionym angielskim — transkrypcja wychodzi bełkotem, jak zauważa sekcja o rozwiązywaniu problemów. Automatycznego wykrywania nie ma.
Nic z tego nie jest krytyką inżynierii. To opis architektury: bardzo dobra chmurowa usługa transkrypcji, wbudowana w jedną aplikację i dostępna dla jednego rodzaju konta.
Gdzie się kończy w codziennej pracy programisty
Warunki dotyczące konta i sieci dla jednych mają znaczenie, dla innych nie. Dwa ograniczenia dotykają wszystkich.
Działa tylko w polu promptu Claude Code. W chwili, gdy przełączysz się na sesję Codex, czat w Cursorze, issue na GitHubie w przeglądarce, wiadomość commita w edytorze albo wątek na Slacku, głosu już nie ma. Programiści, którzy rozmawiają z agentami, rzadko rozmawiają tylko z jednym.
Dźwięk opuszcza komputer. Przy prywatnym projekcie pobocznym nikogo to nie obchodzi. Przy kodzie klienta objętym NDA, u pracodawcy z branży regulowanej albo po prostu u programisty, który nie bez powodu wybrał modele lokalne, to granica. Niektóre organizacje już wyłączyły tę funkcję zasadami, co Claude Code zgłasza komunikatem „Voice mode is disabled by your organization's policy”.
Alternatywa lokalna — zmierzona
Systemowy klawisz dyktowania omija oba ograniczenia: naciskasz go w dowolnym oknie, mówisz, naciskasz ponownie, a tekst trafia tam, gdzie był kursor, przepisany przez model Whisper na Twojej własnej karcie graficznej. Oczywiste pytanie brzmi: czy lokalna transkrypcja jest na tyle szybka, żeby przypominała rozmowę? Zmierzyliśmy nasz własny silnik, ten w AlphaDictate, na laptopie, na którym powstał ten artykuł: z dedykowaną kartą NVIDIA RTX 5070 Ti w wersji laptopowej i zintegrowanym układem AMD Radeon 890M. Nagranie testowe to 77 sekund syntetycznej angielskiej mowy o spotkaniu produktowym, pocięte na typowe długości nagrań; każda liczba to mediana z trzech przebiegów przez silnik, który dostarczamy w aplikacji, bez ułamka sekundy potrzebnego na samo wklejenie.
| Długość nagrania | Model Szybki, karta dedykowana | Model Najlepszy, karta dedykowana | Model Szybki, grafika zintegrowana | Model Najlepszy, grafika zintegrowana |
|---|---|---|---|---|
| 5 sekund | 0,13 s | 0,29 s | 0,31 s | 1,2 s |
| 15 sekund | 0,30 s | 0,77 s | 0,64 s | 2,0 s |
| 60 sekund | 1,6 s | 3,0 s | 2,7 s | 9,3 s |
Wczytanie modelu do GPU odbywa się raz i trwało od jednej do dwóch i pół sekundy, zależnie od rozmiaru. Typowy prompt dla agenta to od dziesięciu do dwudziestu sekund mowy, więc na dedykowanej karcie tekst pojawia się niecałą sekundę po tym, jak skończysz mówić, nawet z najdokładniejszym modelem, a na grafice zintegrowanej po około dwóch sekundach — albo wyraźnie poniżej sekundy, jeśli wybierzesz model Szybki. Dyktowanie w chmurze nie jest zauważalnie szybsze, gdy doliczyć drogę do serwera i z powrotem, a lokalne nie zwalnia przy słabym łączu.
Dłuższe nagrania rzadko każą czekać nawet tyle: AlphaDictate przepisuje dotychczasową wypowiedź przy każdej pauzie, a Ty mówisz dalej, więc po minucie dyktowania z pauzami zostaje tylko ostatni fragment — około pół sekundy na dedykowanej karcie i dwie sekundy na zintegrowanej z najdokładniejszym modelem. Te liczby są w naszym artykule o GPU.
Dwa uczciwe zastrzeżenia. Syntetyczna mowa jest czystsza niż człowiek mamroczący do mikrofonu w laptopie, więc ten test nie mierzy dokładności, tylko opóźnienie. A kolumny z grafiką zintegrowaną dotyczą laptopa z 2025 roku; starsze układy zintegrowane będą wolniejsze, dlatego aplikacja oferuje trzy rozmiary modelu i przy pierwszym uruchomieniu podpowiada, który z nich udźwignie Twój sprzęt.
Problem z terminalem, o którym nikt nie mówi
Każde narzędzie do dyktowania w Windows, łącznie z naszym, wprowadza tekst do terminala w ten sam sposób: umieszcza transkrypcję w schowku i wysyła polecenie wklejenia. Windows Terminal, terminal w VS Code i konsola, w której działa Claude Code, przyjmują Ctrl+V, więc to działa. Dwie rzeczy to psują — i psują w każdym narzędziu.
Pierwsza to terminal z podwyższonymi uprawnieniami. Jeśli uruchamiasz powłokę jako administrator, Windows po cichu odrzuca naciśnięcia klawiszy wstrzyknięte przez program o zwykłych uprawnieniach, a wklejenie pozornie nic nie robi, bez żadnego komunikatu o błędzie. AlphaDictate sprawdza to przed wklejeniem i informuje, że tekst jest w schowku, więc możesz samodzielnie nacisnąć Ctrl+V, zamiast stracić nagranie. Druga to sam schowek: wklejenie zastępuje to, co było w nim wcześniej. Celowo zostawiamy transkrypcję w schowku, żeby wklejenie, które z jakiegokolwiek powodu się nie udało, dało się powtórzyć jednym Ctrl+V, a każde nagranie trafia też do lokalnej historii aplikacji. Jeśli dyktujesz w trakcie kopiowania czegoś cennego, skopiuj to potem jeszcze raz. Taka jest cena i wolimy powiedzieć o niej tutaj, niż żeby zaskoczyła Cię później.
Konfiguracja lokalnego klawisza dyktowania do pracy z agentami
- Zainstaluj lokalną aplikację do dyktowania i pozwól jej pobrać model. Wybierz model Szybki, jeśli masz grafikę zintegrowaną i chcesz wyników poniżej sekundy; na dedykowanym GPU wybierz Najlepszy.
- Przypisz ją do czegoś, co trafisz bez patrzenia. Do pracy z agentami idealny jest boczny przycisk myszy: ręka na myszy, naciskasz, mówisz, naciskasz, prompt się wypełnia.
- Jeśli myślisz w więcej niż jednym języku, zostaw język na automatycznym wykrywaniu. Whisper podąży za Tobą nawet w środku zdania.
- Raz dopisz do podpowiedzi słownikowej nietypowe słowa z projektu: nazwy wewnętrznych usług, bibliotekę, którą ciągle wymieniasz, nazwisko wspólnika.
- Jeśli lubisz podgląd na żywo w Claude Code, zostaw też jego tryb głosowy włączony. Te dwa rozwiązania sobie nie przeszkadzają: jedno to klawisz w jednej aplikacji, drugie — klawisz wszędzie.
Robimy AlphaDictate, więc czytaj tę rekomendację z tą świadomością i pamiętaj, że darmową alternatywą w tej samej kategorii jest Handy — lokalna aplikacja do dyktowania o otwartym kodzie, z mniejszą liczbą funkcji i bez opłat. Nasz wcześniejszy tekst o wpisywaniu głosowym w Windows omawia wbudowaną opcję, która też wysyła dźwięk na serwer i też kończy się na jednym języku.
Najczęstsze pytania
Czy tryb głosowy Claude Code przetwarza dźwięk lokalnie? Nie. Dokumentacja Anthropic stwierdza, że dźwięk jest przesyłany do transkrypcji na serwery Anthropic i nie jest przetwarzany lokalnie.
Dlaczego /voice pisze, że wymaga konta Claude.ai? Usługa zamiany mowy na tekst jest dostępna tylko po zalogowaniu kontem claude.ai. Sesje Claude Code uwierzytelnione kluczem API, przez Bedrock, Agent Platform w Google Cloud albo Microsoft Foundry nie mogą z niej korzystać.
Czy mogę dyktować do Claude Code przez SSH? Nie wbudowanym trybem głosowym, który wymaga lokalnego mikrofonu. Systemowa aplikacja do dyktowania działająca na Twoim komputerze wpisuje tekst do terminala SSH tak samo jak do każdego innego okna.
Jakie języki obsługuje tryb głosowy Claude Code? Dwadzieścia, w tym angielski, niemiecki, francuski, hiszpański, portugalski, polski, japoński, koreański i ukraiński. Język wybiera się w ustawieniu, nie jest wykrywany automatycznie.
Jak szybkie jest lokalne dyktowanie na laptopie? Na zmierzonym przez nas laptopie piętnastosekundowe nagranie zostało przepisane w niecałą sekundę na dedykowanej karcie z najdokładniejszym modelem i w około dwie sekundy na grafice zintegrowanej — albo w niecałą sekundę z modelem Szybki.
Czy dyktowanie działa w terminalu uruchomionym jako administrator? W Windows okna z podwyższonymi uprawnieniami ignorują wstrzyknięte wklejanie — w każdym narzędziu. AlphaDictate to wykrywa i zostawia tekst w schowku do ręcznego wklejenia przez Ctrl+V.
Ten artykuł przetłumaczyła z angielskiego maszyna; sprawdziliśmy, czy ma sens, ale nie recenzował go native speaker. Wersją odniesienia jest angielska.