Claude Code unter Windows: was /voice sendet — und wie es lokal geht
Mit einem Coding-Agenten zu sprechen ist für viele Entwickler die erste Art von Diktat, die sie überhaupt je wollten. Prompts sind lang, im Plauderton und voller Formulierungen wie „bau die Auth-Middleware um“, und sie zu tippen dauert länger, als sie auszusprechen. Claude Code bringt inzwischen einen Sprachmodus mit, und der ist gut. Dieser Artikel erklärt genau, was er mit deinem Audio macht, wo er an Grenzen stößt, und liefert Messwerte für die Alternative: eine Diktattaste, die in jedem Terminal, jedem Chatfenster und jedem Editor auf dem Rechner funktioniert, während das Sprachmodell auf deiner eigenen GPU läuft.
Was der Sprachmodus von Claude Code kann
Du schaltest ihn mit /voice ein. Im standardmäßigen Hold-Modus hältst du beim Sprechen die Leertaste gedrückt; im Tap-Modus drückst du einmal kurz zum Starten und einmal zum Senden. Der Text erscheint schon während des Sprechens im Prompt, abgeblendet, bis er feststeht, und du kannst in derselben Nachricht tippen und sprechen. Die Aufnahme endet von selbst nach fünfzehn Sekunden Stille oder nach insgesamt zwei Minuten. Die Transkription ist auf Code-Vokabular abgestimmt, und Claude Code gibt ganz nebenbei deinen Projektnamen und deinen Git-Branch als Erkennungshinweise mit — ein cleverer Kniff. Auf deine Nutzungslimits wird das nicht angerechnet.
Und jetzt der Teil, den Anthropics eigene Dokumentation gleich als erste Voraussetzung nennt: „Die Sprachdiktierfunktion streamt dein aufgenommenes Audio zur Transkription an die Server von Anthropic. Audio wird nicht lokal verarbeitet.“ (im Original: „Voice dictation streams your recorded audio to Anthropic's servers for transcription. Audio is not processed locally.“) Aus diesem Satz folgen drei Dinge, die auf derselben Seite ausgeführt werden.
- Er braucht ein claude.ai-Konto. Der Sprachdienst steht nicht zur Verfügung, wenn Claude Code mit einem API-Schlüssel, über Amazon Bedrock, die Agent Platform von Google Cloud oder Microsoft Foundry läuft. Unternehmen, die aus Gründen der Datenresidenz genau diese Wege gewählt haben, bekommen keinen Sprachmodus — konsequent, wenn auch unpraktisch.
- Er braucht ein lokales Mikrofon. Kein Sprachmodus in SSH-Sitzungen, in Claude Code im Web, in VS Code Remote, Dev Containers oder Codespaces und auch nicht in WSL1.
- Er spricht zwanzig Sprachen, aber immer nur eine. Das Diktat folgt der Einstellung
languageund steht standardmäßig auf Englisch. Stellst du sie auf Deutsch, diktierst du auf Deutsch; sprichst du Deutsch, während sie auf Englisch steht, kommt Kauderwelsch heraus, wie der Abschnitt zur Fehlerbehebung anmerkt. Eine automatische Erkennung gibt es nicht.
Nichts davon ist Kritik an der Technik. Es beschreibt eine Architektur: ein sehr guter Transkriptionsdienst in der Cloud, eingebettet in eine einzige Anwendung, verfügbar für eine einzige Art von Konto.
Wo er im Entwickleralltag an Grenzen stößt
Die Bedingungen rund um Konto und Netzwerk sind manchen wichtig, anderen nicht. Zwei Grenzen treffen alle.
Er funktioniert nur im Prompt von Claude Code. Sobald du zu einer Codex-Sitzung wechselst, zu einem Cursor-Chat, einem GitHub-Issue im Browser, einer Commit-Nachricht im Editor oder einem Slack-Thread, ist es mit der Spracheingabe vorbei. Wer mit Agenten spricht, spricht selten nur mit einem.
Das Audio verlässt den Rechner. Bei einem privaten Nebenprojekt stört das niemanden. Bei der Codebasis eines Kunden unter NDA, bei einem Arbeitgeber in einer regulierten Branche oder schlicht für Entwickler, die sich aus gutem Grund für lokale Modelle entschieden haben, ist es eine rote Linie. Manche Organisationen haben die Funktion bereits per Richtlinie abgeschaltet, was Claude Code mit „Voice mode is disabled by your organization's policy“ meldet.
Die lokale Alternative, nachgemessen
Eine systemweite Diktattaste umgeht beide Grenzen: in einem beliebigen Fenster drücken, sprechen, noch einmal drücken, und der Text landet dort, wo der Cursor stand, transkribiert von einem Whisper-Modell auf deiner eigenen Grafikkarte. Die naheliegende Frage ist, ob lokale Transkription schnell genug ist, um sich wie ein Gespräch anzufühlen. Wir haben unsere eigene Engine gemessen, die in AlphaDictate steckt, und zwar auf dem Laptop, auf dem dieser Artikel entstanden ist: mit einer dedizierten NVIDIA RTX 5070 Ti Laptop-GPU und einer integrierten AMD Radeon 890M. Der Clip besteht aus 77 Sekunden synthetisch erzeugter englischer Sprache über ein Produktmeeting, zerschnitten in typische Aufnahmelängen; jede Zahl ist der Median aus drei Durchläufen durch die ausgelieferte Engine, ohne den Sekundenbruchteil, den das Einfügen selbst dauert.
| Aufnahmelänge | Schnell, dedizierte GPU | Beste, dedizierte GPU | Schnell, integrierte GPU | Beste, integrierte GPU |
|---|---|---|---|---|
| 5 Sekunden | 0,13 s | 0,29 s | 0,31 s | 1,2 s |
| 15 Sekunden | 0,30 s | 0,77 s | 0,64 s | 2,0 s |
| 60 Sekunden | 1,6 s | 3,0 s | 2,7 s | 9,3 s |
Ein Modell in die GPU zu laden, passiert einmal und dauerte je nach Größe zwischen einer und zweieinhalb Sekunden. Ein typischer Prompt an einen Agenten umfasst zehn bis zwanzig Sekunden Sprache. Auf einer dedizierten GPU erscheint der Text mit dem genauesten Modell also weniger als eine Sekunde, nachdem du aufgehört hast zu sprechen, auf einer integrierten GPU nach etwa zwei Sekunden — oder deutlich unter einer Sekunde, wenn du das Modell Schnell wählst. Diktat in der Cloud ist nicht nennenswert schneller, sobald man den Hin- und Rückweg mitrechnet, und die lokale Variante wird bei schlechter Verbindung nicht langsamer.
Bei längeren Aufnahmen wartest du selten auch nur so lange: AlphaDictate transkribiert das bereits Gesagte bei jeder Pause, während du weiterredest. Nach einer Minute Diktat mit Pausen bleibt deshalb nur das letzte Stück übrig — mit dem genauesten Modell etwa eine halbe Sekunde auf der dedizierten GPU und zwei Sekunden auf der integrierten. Die Zahlen dazu stehen in unserem GPU-Artikel.
Zwei ehrliche Einschränkungen. Synthetische Sprache ist sauberer als ein Mensch, der in ein Laptop-Mikrofon nuschelt; dieser Test misst also nicht die Genauigkeit, sondern die Wartezeit. Und die Werte der integrierten GPU stammen von einem Laptop aus dem Jahr 2025; ältere integrierte Grafik ist langsamer. Deshalb bietet die App drei Modellgrößen an und sagt dir beim ersten Start, welche davon deine Hardware schafft.
Das Terminal-Problem, über das niemand spricht
Jedes Diktierwerkzeug unter Windows, unseres eingeschlossen, bringt Text auf dieselbe Weise in ein Terminal: Es legt den Text in die Zwischenablage und löst ein Einfügen aus. Windows Terminal, das Terminal in VS Code und die Konsole, in der Claude Code läuft, akzeptieren alle Ctrl+V, also funktioniert das. Zwei Dinge machen es kaputt, und zwar bei jedem Werkzeug.
Das erste ist ein Terminal mit Administratorrechten. Läuft deine Shell als Administrator, verwirft Windows stillschweigend Tastendrücke, die ein Programm mit normalen Rechten einschleust, und das Einfügen scheint einfach nichts zu tun, ohne Fehlermeldung, nirgends. AlphaDictate prüft das vor dem Einfügen und sagt dir, dass der Text in der Zwischenablage liegt, damit du selbst Ctrl+V drücken kannst, statt die Aufnahme zu verlieren. Das zweite ist die Zwischenablage selbst: Das Einfügen ersetzt, was du vorher kopiert hattest. Wir lassen den Text bewusst in der Zwischenablage, damit ein Einfügen, das aus irgendeinem Grund gescheitert ist, nur ein Ctrl+V entfernt ist, und jede Aufnahme landet zusätzlich im lokalen Verlauf der App. Wenn du mitten im Kopieren von etwas Wichtigem diktierst, kopiere es danach noch einmal. Das ist der Preis, und wir sagen es lieber hier, als dass du es selbst herausfindest.
Eine lokale Diktattaste für die Arbeit mit Agenten einrichten
- Installiere eine lokale Diktier-App und lass sie ein Modell herunterladen. Nimm das Modell Schnell, wenn du integrierte Grafik hast und Ergebnisse in unter einer Sekunde willst; nimm Beste auf einer dedizierten GPU.
- Leg sie auf etwas, das du blind triffst. Eine seitliche Maustaste ist ideal für die Arbeit mit Agenten: Hand an der Maus, drücken, sprechen, drücken, und der Prompt füllt sich.
- Lass die Sprache auf „Automatisch erkennen“, wenn du in mehr als einer Sprache denkst. Whisper folgt dir mitten im Satz.
- Trag die ungewöhnlichen Wörter deines Projekts einmal in den Vokabel-Hinweis ein: interne Dienstnamen, die Bibliothek, die du ständig erwähnst, den Nachnamen deines Mitgründers.
- Lass den Sprachmodus von Claude Code ruhig ebenfalls eingeschaltet, wenn dir seine Live-Vorschau gefällt. Die beiden kommen sich nicht in die Quere: Das eine ist eine Taste in einer App, das andere eine Taste überall.
Wir stellen AlphaDictate her, lies die Empfehlung also mit diesem Wissen. Die kostenlose Alternative in derselben Kategorie ist Handy, eine lokale Open-Source-Diktier-App mit weniger Funktionen, die nichts kostet. Unser früherer Beitrag zur Windows-Spracheingabe behandelt die eingebaute Option, die ebenfalls Audio an einen Server schickt und ebenfalls nur eine Sprache auf einmal kann.
Häufige Fragen
Verarbeitet der Sprachmodus von Claude Code das Audio lokal? Nein. Laut Anthropics Dokumentation wird das Audio zur Transkription an die Server von Anthropic gestreamt und nicht lokal verarbeitet.
Warum sagt /voice, dass ein Claude.ai-Konto nötig ist? Der Dienst für Sprache zu Text wird nur für claude.ai-Anmeldungen angeboten. Claude-Code-Sitzungen, die per API-Schlüssel, Bedrock, die Agent Platform von Google Cloud oder Microsoft Foundry authentifiziert sind, können ihn nicht nutzen.
Kann ich über SSH in Claude Code diktieren? Nicht mit dem eingebauten Sprachmodus, denn der braucht ein lokales Mikrofon. Eine systemweite Diktier-App auf deinem lokalen Rechner schreibt ins SSH-Terminal wie in jedes andere Fenster.
Welche Sprachen unterstützt der Sprachmodus von Claude Code? Zwanzig, darunter Englisch, Deutsch, Französisch, Spanisch, Portugiesisch, Polnisch, Japanisch, Koreanisch und Ukrainisch. Welche gilt, legt die Spracheinstellung fest; erkannt wird die Sprache nicht.
Wie schnell ist lokales Diktieren auf einem Laptop? Auf dem Laptop, den wir gemessen haben, wurde eine Aufnahme von fünfzehn Sekunden mit dem genauesten Modell auf der dedizierten GPU in unter einer Sekunde transkribiert und auf der integrierten GPU in etwa zwei Sekunden, mit dem Modell Schnell in unter einer Sekunde.
Funktioniert Diktieren in einem Terminal mit Administratorrechten? Fenster mit erhöhten Rechten ignorieren unter Windows eingeschleuste Einfügebefehle, bei jedem Werkzeug. AlphaDictate erkennt das und lässt den Text für ein manuelles Ctrl+V in der Zwischenablage.
Dieser Artikel wurde maschinell aus dem Englischen übersetzt und auf Verständlichkeit geprüft, jedoch nicht von einem Muttersprachler. Maßgeblich ist die englische Fassung.