Blogg / Vilken GPU behöver du för lokal diktering? Troligen den du har

Vilken GPU behöver du för lokal diktering? Troligen den du har

"Körs på din GPU" låter som att det kräver en speldator. Det gör det inte. Vi tog tid på vår egen dikteringsmotor på de två grafikkretsarna i en helt vanlig bärbar dator från 2025: ett diskret NVIDIA RTX 5070 Ti-grafikkort för bärbara datorer och AMD Radeon 890M, som är integrerad i processorn — den sortens grafik som följer med på köpet i en bärbar dator i mellanklassen. Båda gör om ett typiskt talat stycke till text snabbare än du hinner flytta handen från tangenten till musen, och vid lång diktering döljer appen det mesta av den återstående väntan genom att arbeta medan du pratar. Här finns siffrorna, hur mycket minne varje modell behöver och den enda sortens dator där lokal diktering inte fungerar.

Så mätte vi

Ljudet är ett 77 sekunder långt klipp med syntetiskt engelskt tal om ett produktmöte, uppdelat i de längder folk faktiskt dikterar: 5 sekunder för ett chattsvar, 15 för ett stycke eller en prompt till en AI-agent, 60 för ett långt mejl. Varje klipp kördes tre gånger per mätpunkt genom exakt den motor som AlphaDictate levereras med, Whisper via whisper.cpp på Vulkan; tabellerna visar medianen. Tidtagningen omfattar bara transkriberingen, från det ögonblick du slutar prata till det ögonblick texten finns, och räknar inte med den bråkdel av en sekund som inklistringen tar. Varje körning gav hela texten, så de snabba siffrorna beror inte på att motorn hoppar över ljud.

De tre modellerna är appens tre nivåer: Snabb är Whisper Small, Balanserad är Whisper Medium och Bäst är Whisper Large v3, alla komprimerade till 5-bitars vikter.

Ett talat stycke: 15 sekunders tal

GrafikSnabbBalanseradBäst
RTX 5070 Ti för bärbara datorer, diskret0,30 s0,55 s0,77 s
Radeon 890M, integrerad0,64 s1,2 s2,0 s

På det diskreta grafikkortet blir alla modeller klara på under en sekund, så det finns ingen anledning att välja något annat än Bäst. På integrerad grafik tar Bäst ungefär två sekunder, vilket märks men inte stör när det gäller ett mejl; Snabb klarar det på under en sekund och hanterar fortfarande tydligt tal bra.

En lång tagning, och varför du sällan väntar på hela

Transkriberad i ett stycke är en minuts tal där de två kretsarna går isär:

60 sekunder, allt på en gångSnabbBalanseradBäst
RTX 5070 Ti för bärbara datorer, diskret1,6 s2,3 s3,0 s
Radeon 890M, integrerad2,7 s5,4 s9,3 s

Nio sekunder efter en minuts prat vore irriterande tio gånger om dagen. Så långt går det sällan, eftersom AlphaDictate inte väntar på att du ska bli klar. När den har åtta sekunders ljud och du gör en paus, fem sekunder som standard, lämnar den över det du sagt hittills till GPU:n och fortsätter lyssna. När du trycker på stopp återstår bara delen sedan din senaste paus. Sammanhängande tal delas aldrig upp, så inget ord klyvs mitt itu.

För att mäta det byggde vi en tagning så som folk faktiskt dikterar: ungefär en minuts tal i fyra avsnitt på 13 till 18 sekunder, med en tankepaus på fem sekunder mellan dem, 74 sekunder totalt. Vi spelade upp den genom appens egen delningslogik i verklig takt och tog tid på väntan efter stopp:

En minuts diktering med pauserSnabb, allt på en gångSnabb, delat vid pauserBäst, allt på en gångBäst, delat vid pauser
RTX 5070 Ti för bärbara datorer, diskret1,4 s0,24 s2,8 s0,53 s
Radeon 890M, integrerad3,1 s0,57 s11,0 s2,1 s

Delningen kortar väntan ungefär fem gånger på båda kretsarna. Med den mest träffsäkra modellen svarar integrerad grafik på en minuts diktering på ungefär två sekunder, lika snabbt som på ett enda stycke, eftersom bara ditt sista stycke återstår när du trycker på stopp.

Vår egen användning av appen på den här datorn visar samma sak. Under den senaste veckans diktering hade ungefär hälften av tagningarna som var längre än 20 sekunder en paus som var lång nog att dela vid. För dem återstod i median 13 sekunders tal att transkribera efter stopp, och medianväntan var 0,8 sekunder. Långa tagningar utan en sådan paus väntade i median 1,7 sekunder. Pausens längd är en inställning, Paus som avslutar en del under Träffsäkerhet & fart, och kan sänkas ända till två sekunder om du vill ha resultat tidigare och talar utan att tveka.

En inspelning: en fil på 10 minuter

GrafikSnabbBäst
RTX 5070 Ti för bärbara datorer, diskret16 s28 s
Radeon 890M, integrerad36 s1 min 54 s

Filer får inget försprång, eftersom hela inspelningen finns där innan transkriberingen börjar, så det är här ett diskret grafikkort gör skäl för sig. En mötesinspelning på en timme tar ungefär tre minuter på det diskreta kortet med den bästa modellen; på integrerad grafik ungefär elva. Båda slår att skicka en timme av ett konfidentiellt möte till en molntjänst och vänta på att texten kommer tillbaka.

Hur mycket minne varje modell behöver

ModellAnvänt GPU-minne
Snabbcirka 0,6 GB
Balanseradcirka 1,2 GB
Bästcirka 2,1 GB

Vi läste av dem i Windows egna GPU-räknare per process medan respektive modell var inläst, och de var desamma på båda kretsarna. Två praktiska följder. Ett diskret grafikkort med 4 GB minne rymmer även den största modellen med marginal, så kortets ålder spelar större roll än dess minnesmängd. Och integrerad grafik har inget eget minne: den lånar systemets RAM, så på en bärbar dator med 8 GB tar Bäst en fjärdedel av det. På en sådan dator är Balanserad det hänsynsfulla valet; med 16 GB eller mer spelar det ingen roll.

Varför det inte finns någon processorversion

Den enda sortens dator som lokal diktering inte passar är en dator helt utan användbar GPU: en fjärrskrivbordssession, en virtuell maskin, en server. Vi byggde en version som bara körde på processorn och mätte den till fem till tjugo gånger långsammare än integrerad grafik, vilket gör en väntan på två sekunder till en halv minut. Vi tog bort den samma dag. Ett dikteringsverktyg som i tysthet tar trettio sekunder är sämre än ett som rakt ut säger att det behöver ett grafikchip, så AlphaDictate letar efter en GPU med Vulkan-drivrutin vid första starten och säger till om den inte hittar någon.

I praktiken har nästan varje Windows-dator som sålts de senaste åren en sådan, integrerad eller diskret. Det som brukar stå i vägen är en gammal grafikdrivrutin, och det löser du genom att uppdatera den från tillverkarens webbplats.

Vad du ska välja

  • Stationär eller bärbar speldator med ett diskret grafikkort från NVIDIA eller AMD: Bäst. Allt går på under en sekund, och du får de mest träffsäkra texterna.
  • Nyare bärbar dator med integrerad grafik och 16 GB RAM: Bäst. Korta stycken tar ungefär två sekunder och långa knappt mer, tack vare delningen vid pauser. Balanserad om du transkriberar många långa inspelningar.
  • Bärbar dator med 8 GB RAM: Balanserad, eller Snabb om datorn är äldre.
  • Äldre eller strömsnål integrerad grafik: börja med Snabb. Vi har inte mätt äldre kretsar än, så se siffrorna för integrerad grafik ovan som den övre gränsen för vad integrerad grafik klarar.
  • En bärbar dator med båda kretsarna: du behöver inte välja. AlphaDictate använder den diskreta GPU:n när den är tillgänglig och den integrerade när den diskreta är avstängd för att spara ström, och byter mellan dem i pausen mellan två tagningar.

AlphaDictates introduktion visar vilken grafik den hittade och föreslår en modell att börja med: Bäst på datorer med NVIDIA-grafik, Balanserad på övriga. Modellen byter du senare med ett klick, och alla tre ingår i priset, 39 $/år efter en gratis timme. Vad din egen dator har ser du i Aktivitetshanteraren under Prestanda, där varje GPU visas med sitt minne.

Har du en GPU som vi inte har mätt, särskilt en äldre integrerad krets från Intel eller AMD, tar vi gärna emot dina siffror på hello@alphadictate.com. Vår artikel om att diktera till Claude Code använder samma mätningar ur en utvecklares perspektiv.


Vanliga frågor

Behöver jag ett spelgrafikkort för lokal taligenkänning? Nej. På den integrerade grafiken i en bärbar dator från 2025 transkriberas ett talat stycke på 15 sekunder på ungefär två sekunder med Whisper Large v3 och på under en sekund med den minsta modellen.

Måste jag vänta på att en lång diktering transkriberas från början? Nej. AlphaDictate transkriberar det du sagt vid varje paus medan du fortsätter prata, så efter en minuts diktering med pauser var väntan ungefär två sekunder på integrerad grafik och en halv sekund på en diskret GPU, med den mest träffsäkra modellen.

Hur mycket VRAM behöver Whisper Large v3? Ungefär 2,1 GB i den komprimerade form som AlphaDictate använder. Whisper Medium behöver ungefär 1,2 GB och Whisper Small ungefär 0,6 GB.

Kan Whisper köras på integrerad grafik? Ja, via en Vulkan-drivrutin. Integrerad grafik använder systemminnet, så modellens minne tas från ditt RAM.

Fungerar AlphaDictate utan GPU? Nej. Den behöver ett grafikchip med Vulkan-drivrutin, integrerat eller diskret. En version som bara använde processorn var fem till tjugo gånger långsammare än integrerad grafik, så vi levererar ingen sådan.

Hur lång tid tar det att transkribera en timmes ljud lokalt? I vår mätning ungefär tre minuter på ett RTX 5070 Ti för bärbara datorer och ungefär elva minuter på integrerad Radeon 890M-grafik, med den mest träffsäkra modellen.

Den här artikeln är maskinöversatt från engelska och kontrollerad för innehåll, men inte av en modersmålstalare. Den engelska versionen gäller.