Welche GPU braucht lokales Diktieren? Wahrscheinlich die, die du hast
„Läuft auf deiner GPU“ klingt, als bräuchte man einen Gaming-PC. Braucht man nicht. Wir haben unsere eigene Diktier-Engine auf den beiden Grafikchips eines ganz gewöhnlichen Laptops von 2025 gemessen: einer dedizierten NVIDIA RTX 5070 Ti Laptop-GPU und der in den Prozessor integrierten AMD Radeon 890M, also der Art Grafik, die in der CPU eines Mittelklasse-Laptops gleich mit drinsteckt. Beide machen aus einem typischen gesprochenen Absatz schneller Text, als du die Hand von der Taste zur Maus bewegen kannst, und bei langen Diktaten verbirgt die App den Großteil der restlichen Wartezeit, indem sie arbeitet, während du sprichst. Auf dieser Seite stehen die Zahlen, der Speicher, den jedes Modell braucht, und die eine Art von Rechner, auf der lokales Diktieren nicht funktioniert.
Wie wir gemessen haben
Das Audio ist ein 77 Sekunden langer Clip synthetisch erzeugter englischer Sprache über ein Produktmeeting, zerschnitten in die Längen, die Menschen tatsächlich diktieren: 5 Sekunden für eine Chat-Antwort, 15 für einen Absatz oder einen Prompt an einen KI-Agenten, 60 für eine lange E-Mail. Jeder Clip lief pro Messpunkt dreimal durch genau die Engine, die AlphaDictate ausliefert, Whisper über whisper.cpp auf Vulkan; die Tabellen zeigen den Median. Gemessen wird nur die Transkription, von dem Moment, in dem du aufhörst zu sprechen, bis zu dem Moment, in dem der Text da ist, ohne den Sekundenbruchteil, den das Einfügen dauert. Jeder Durchlauf lieferte das vollständige Transkript; die schnellen Zahlen kommen also nicht daher, dass die Engine Audio überspringt.
Die drei Modelle sind die drei Stufen der App: Schnell ist Whisper Small, Ausgewogen ist Whisper Medium und Beste ist Whisper Large v3, alle auf 5-Bit-Gewichte komprimiert.
Ein gesprochener Absatz: 15 Sekunden Sprache
| Grafik | Schnell | Ausgewogen | Beste |
|---|---|---|---|
| RTX 5070 Ti Laptop-GPU, dediziert | 0,30 s | 0,55 s | 0,77 s |
| Radeon 890M, integriert | 0,64 s | 1,2 s | 2,0 s |
Auf der dedizierten Karte ist jedes Modell in unter einer Sekunde fertig; es gibt also keinen Grund, etwas anderes als Beste zu wählen. Auf integrierter Grafik braucht das Modell Beste etwa zwei Sekunden, was du merkst, was dich bei einer E-Mail aber nicht stört; das Modell Schnell bleibt unter einer Sekunde und kommt mit deutlicher Sprache immer noch gut zurecht.
Eine lange Aufnahme, und warum du selten auf alles wartest
Am Stück transkribiert, trennen sich bei einer Minute Sprache die Wege der beiden Chips:
| 60 Sekunden, am Stück | Schnell | Ausgewogen | Beste |
|---|---|---|---|
| RTX 5070 Ti Laptop-GPU, dediziert | 1,6 s | 2,3 s | 3,0 s |
| Radeon 890M, integriert | 2,7 s | 5,4 s | 9,3 s |
Neun Sekunden Warten nach einer Minute Sprechen würden zehnmal am Tag nerven. Dazu kommt es selten, denn AlphaDictate wartet nicht, bis du fertig bist. Sobald es acht Sekunden Audio hat und du eine Pause machst, standardmäßig fünf Sekunden, gibt es das bisher Gesagte an die GPU weiter und hört weiter zu. Wenn du stoppst, ist nur noch der Teil seit deiner letzten Pause übrig. Ununterbrochenes Sprechen wird nie geteilt, ein Wort wird also nie in der Mitte zerschnitten.
Um das zu messen, haben wir eine Aufnahme so gebaut, wie Menschen tatsächlich diktieren: etwa eine Minute Sprache in vier Abschnitten von 13 bis 18 Sekunden, dazwischen jeweils fünf Sekunden Denkpause, insgesamt 74 Sekunden. Wir haben sie im echten Zeitablauf durch die Aufteilungslogik der App geschickt und die Wartezeit nach dem Stopp gemessen:
| Eine Minute Diktat mit Pausen | Schnell, am Stück | Schnell, an Pausen geteilt | Beste, am Stück | Beste, an Pausen geteilt |
|---|---|---|---|---|
| RTX 5070 Ti Laptop-GPU, dediziert | 1,4 s | 0,24 s | 2,8 s | 0,53 s |
| Radeon 890M, integriert | 3,1 s | 0,57 s | 11,0 s | 2,1 s |
Das Aufteilen verkürzt die Wartezeit auf beiden Chips etwa auf ein Fünftel. Mit dem genauesten Modell liefert integrierte Grafik eine Minute Diktat in etwa zwei Sekunden, genauso schnell wie einen einzelnen Absatz, denn wenn du stoppst, ist nur noch dein letzter Absatz übrig.
Unsere eigene Nutzung der App auf diesem Laptop zeigt dasselbe Bild. In der letzten Woche, in der wir damit diktiert haben, hatte etwa die Hälfte der Aufnahmen über 20 Sekunden eine Pause, die zum Aufteilen lang genug war. Bei diesen blieben nach dem Stopp im Median 13 Sekunden Sprache zu transkribieren, und die Wartezeit lag im Median bei 0,8 Sekunden. Lange Aufnahmen ohne eine solche Pause warteten im Median 1,7 Sekunden. Die Pausenlänge ist eine Einstellung, „Pause, die einen Teil beendet“ unter „Genauigkeit & Tempo“, und lässt sich bis auf zwei Sekunden senken, wenn du Ergebnisse früher willst und ohne Zögern sprichst.
Eine Aufzeichnung: eine Datei von 10 Minuten
| Grafik | Schnell | Beste |
|---|---|---|
| RTX 5070 Ti Laptop-GPU, dediziert | 16 s | 28 s |
| Radeon 890M, integriert | 36 s | 1 min 54 s |
Dateien bekommen keinen Vorsprung, denn die ganze Aufzeichnung liegt vor, bevor die Transkription beginnt. Hier zahlt sich eine dedizierte GPU aus. Eine einstündige Besprechungsaufzeichnung dauert auf der dedizierten Karte mit dem Modell Beste etwa drei Minuten, auf integrierter Grafik etwa elf. Beides ist besser, als eine Stunde einer vertraulichen Besprechung an einen Clouddienst zu schicken und darauf zu warten, dass sie zurückkommt.
Wie viel Speicher jedes Modell braucht
| Modell | Belegter GPU-Speicher |
|---|---|
| Schnell | etwa 0,6 GB |
| Ausgewogen | etwa 1,2 GB |
| Beste | etwa 2,1 GB |
Diese Werte haben wir aus den GPU-Zählern pro Prozess abgelesen, die Windows selbst führt, während das jeweilige Modell geladen war, und sie waren auf beiden Chips gleich. Das hat zwei praktische Folgen. Jede dedizierte Karte mit 4 GB Speicher fasst selbst das größte Modell mit reichlich Luft; das Alter der Karte zählt also mehr als ihr Speicher. Und integrierte Grafik hat keinen eigenen Speicher: Sie leiht sich Arbeitsspeicher vom System, auf einem Laptop mit 8 GB belegt das Modell Beste also ein Viertel davon. Auf so einem Rechner ist Ausgewogen die rücksichtsvolle Wahl; ab 16 GB spielt es keine Rolle.
Warum es keine CPU-Version gibt
Die eine Art von Rechner, der lokales Diktieren nicht gut bedient, ist ein Rechner ganz ohne nutzbare GPU: eine Remotedesktopsitzung, eine virtuelle Maschine, ein Server. Wir haben eine Version gebaut, die nur auf dem Prozessor lief, und sie war in unseren Messungen fünf- bis zwanzigmal langsamer als integrierte Grafik; aus zwei Sekunden Wartezeit wird so eine halbe Minute. Wir haben sie noch am selben Tag wieder entfernt. Ein Diktierwerkzeug, das stillschweigend dreißig Sekunden braucht, ist schlechter als eines, das dir klar sagt, dass es einen Grafikchip braucht. Deshalb prüft AlphaDictate beim ersten Start, ob eine GPU mit Vulkan-Treiber vorhanden ist, und sagt es dir, wenn es keine findet.
In der Praxis hat fast jeder Windows-PC, der in den letzten Jahren verkauft wurde, eine, integriert oder dediziert. Was meist im Weg steht, ist ein alter Grafiktreiber, und ein Update von der Website des Herstellers behebt das.
Was du wählen solltest
- Gaming-PC oder -Laptop mit einer beliebigen dedizierten Karte von NVIDIA oder AMD: Beste. Alles bleibt unter einer Sekunde, und du bekommst die genauesten Transkripte.
- Aktueller Laptop mit integrierter Grafik und 16 GB RAM: Beste. Kurze Passagen dauern etwa zwei Sekunden und lange kaum mehr, dank der Aufteilung an Pausen. Ausgewogen, wenn du viele lange Aufzeichnungen transkribierst.
- Laptop mit 8 GB RAM: Ausgewogen, oder Schnell, wenn der Rechner älter ist.
- Ältere oder sparsame integrierte Grafik: Fang mit Schnell an. Ältere Chips haben wir noch nicht gemessen; betrachte die Werte für integrierte Grafik oben also als das, was integrierte Grafik bestenfalls schafft.
- Ein Laptop mit beiden Chips: Du musst dich nicht entscheiden. AlphaDictate nutzt die dedizierte GPU, wenn sie verfügbar ist, und die integrierte, wenn der dedizierte Chip zum Stromsparen abgeschaltet ist, und wechselt in der Pause zwischen zwei Aufnahmen zwischen ihnen.
Der Einrichtungsbildschirm von AlphaDictate nennt die gefundene Grafik und schlägt ein Startmodell vor: Beste auf Rechnern mit NVIDIA-Grafik, sonst Ausgewogen. Das Modell lässt sich später mit einem Klick wechseln, und alle drei sind im Preis enthalten, 39 $ im Jahr nach einer kostenlosen Stunde. Was in deinem eigenen PC steckt, siehst du im Task-Manager unter „Leistung“, wo jede GPU mit ihrem Speicher aufgeführt ist.
Wenn du eine GPU hast, die wir noch nicht gemessen haben, vor allem einen älteren integrierten Chip von Intel oder AMD, freuen wir uns über deine Zahlen an hello@alphadictate.com. Unser Beitrag zum Diktieren in Claude Code nutzt dieselben Messungen aus der Sicht von Entwicklern.
Häufige Fragen
Brauche ich eine Gaming-GPU für lokale Spracherkennung? Nein. Auf der integrierten Grafik eines Laptops von 2025 wird ein gesprochener Absatz von 15 Sekunden mit Whisper Large v3 in etwa zwei Sekunden transkribiert und mit dem kleinsten Modell in unter einer Sekunde.
Muss ich warten, bis ein langes Diktat von Anfang an transkribiert ist? Nein. AlphaDictate transkribiert das bisher Gesagte bei jeder Pause, während du weiterredest. Nach einer Minute Diktat mit Pausen lag die Wartezeit mit dem genauesten Modell bei etwa zwei Sekunden auf integrierter Grafik und bei einer halben Sekunde auf einer dedizierten GPU.
Wie viel VRAM braucht Whisper Large v3? Etwa 2,1 GB in der komprimierten Form, die AlphaDictate nutzt. Whisper Medium braucht etwa 1,2 GB und Whisper Small etwa 0,6 GB.
Kann Whisper auf integrierter Grafik laufen? Ja, über einen Vulkan-Treiber. Integrierte Grafik nutzt den Systemspeicher, der Speicher für das Modell geht also von deinem RAM ab.
Funktioniert AlphaDictate ohne GPU? Nein. Es braucht einen Grafikchip mit Vulkan-Treiber, integriert oder dediziert. Eine Version nur für den Prozessor war fünf- bis zwanzigmal langsamer als integrierte Grafik, deshalb liefern wir keine aus.
Wie lange dauert es, eine Stunde Audio lokal zu transkribieren? In unserer Messung mit dem genauesten Modell etwa drei Minuten auf einer RTX 5070 Ti im Laptop und etwa elf Minuten auf der integrierten Grafik Radeon 890M.
Dieser Artikel wurde maschinell aus dem Englischen übersetzt und auf Verständlichkeit geprüft, jedoch nicht von einem Muttersprachler. Maßgeblich ist die englische Fassung.