Blogg / Hvilken GPU trenger du for lokal diktering? Sannsynligvis den du har

Hvilken GPU trenger du for lokal diktering? Sannsynligvis den du har

«Kjører på GPU-en din» høres ut som om du trenger en gaming-PC. Det gjør du ikke. Vi tok tiden på vår egen dikteringsmotor på de to grafikkbrikkene i én helt vanlig bærbar fra 2025: en diskret NVIDIA RTX 5070 Ti-GPU for bærbare og AMD Radeon 890M, som er integrert i prosessoren – den typen grafikk som følger med prosessoren i en bærbar i mellomklassen. Begge gjør et typisk muntlig avsnitt om til tekst før du rekker å flytte hånden fra tasten til musen, og ved lang diktering skjuler appen det meste av den gjenværende ventetiden ved å jobbe mens du snakker. Denne siden har tallene, minnet hver modell trenger, og den ene typen maskin der lokal diktering ikke virker.

Slik målte vi

Lyden er et klipp på 77 sekunder med syntetisk engelsk tale om et produktmøte, kuttet i de lengdene folk faktisk dikterer: 5 sekunder for et chattesvar, 15 for et avsnitt eller en prompt til en AI-agent, 60 for en lang e-post. Hvert klipp gikk gjennom nøyaktig den motoren AlphaDictate leverer, Whisper via whisper.cpp på Vulkan, tre ganger per målepunkt; tabellene viser medianen. Tidtakingen dekker bare transkriberingen, fra du slutter å snakke til teksten finnes, og utelater den brøkdelen av et sekund innlimingen tar. Hver kjøring ga hele teksten, så de raske tallene skyldes ikke at motoren hopper over lyd.

De tre modellene er appens tre nivåer: Rask er Whisper Small, Balansert er Whisper Medium, og Best er Whisper Large v3, alle komprimert til 5-biters vekter.

Et muntlig avsnitt: 15 sekunder tale

GrafikkRaskBalansertBest
RTX 5070 Ti for bærbare, diskret0,30 s0,55 s0,77 s
Radeon 890M, integrert0,64 s1,2 s2,0 s

På det diskrete kortet blir hver modell ferdig på under et sekund, så det er ingen grunn til å velge noe annet enn Best. På integrert grafikk bruker Best omtrent to sekunder, noe du merker, men ikke bryr deg om når du skriver en e-post; Rask bruker under et sekund og takler fortsatt tydelig tale godt.

Et langt opptak, og hvorfor du sjelden venter på hele

Når et minutt med tale transkriberes i ett stykke, skilles de to brikkene:

60 sekunder, alt på én gangRaskBalansertBest
RTX 5070 Ti for bærbare, diskret1,6 s2,3 s3,0 s
Radeon 890M, integrert2,7 s5,4 s9,3 s

Ni sekunders venting etter et minutt med prat ville vært irriterende ti ganger om dagen. Så langt kommer det sjelden, fordi AlphaDictate ikke venter på at du blir ferdig. Så snart appen har åtte sekunder med lyd og du tar en pause, fem sekunder som standard, gir den GPU-en det du har sagt så langt, og lytter videre. Når du trykker stopp, gjenstår bare delen etter den siste pausen. Sammenhengende tale deles aldri, så et ord blir aldri kuttet i to.

For å måle det bygde vi et opptak slik folk faktisk dikterer: omtrent et minutt med tale i fire bolker på 13 til 18 sekunder, med en tenkepause på fem sekunder mellom hver, 74 sekunder i alt. Vi spilte det av gjennom appens egen delingslogikk i sanntid og tok tiden på ventetiden etter stopp:

Et minutt diktering med pauserRask, alt på én gangRask, delt ved pauserBest, alt på én gangBest, delt ved pauser
RTX 5070 Ti for bærbare, diskret1,4 s0,24 s2,8 s0,53 s
Radeon 890M, integrert3,1 s0,57 s11,0 s2,1 s

Delingen gjør ventetiden omtrent fem ganger kortere på begge brikkene. Med den mest nøyaktige modellen svarer integrert grafikk på et minutt med diktering på omtrent to sekunder, like raskt som på ett enkelt avsnitt, fordi bare det siste avsnittet ditt gjenstår når du stopper.

Vår egen bruk av appen på denne bærbare forteller det samme. Den siste uken vi dikterte med den, hadde omtrent halvparten av opptakene på over 20 sekunder en pause som var lang nok til å dele på. For dem gjensto det i median 13 sekunder med tale å transkribere etter stopp, og medianventetiden var 0,8 sekunder. Lange opptak uten en slik pause ventet i median 1,7 sekunder. Pauselengden er en innstilling, «Pause som avslutter en del» under «Nøyaktighet og hastighet», og den kan settes helt ned til to sekunder hvis du vil ha resultatene raskere og snakker uten å nøle.

Et lydopptak: en fil på 10 minutter

GrafikkRaskBest
RTX 5070 Ti for bærbare, diskret16 s28 s
Radeon 890M, integrert36 s1 min 54 s

Filer får ikke noe forsprang, siden hele opptaket finnes før transkriberingen begynner, så det er her en diskret GPU viser hva den er verdt. Et møteopptak på én time tar omtrent tre minutter på det diskrete kortet med den beste modellen; på integrert grafikk omtrent elleve. Begge deler er bedre enn å sende en time av et konfidensielt møte til en skytjeneste og vente på at det kommer tilbake.

Hvor mye minne hver modell trenger

ModellBrukt GPU-minne
Raskomtrent 0,6 GB
Balansertomtrent 1,2 GB
Bestomtrent 2,1 GB

Vi leste av disse tallene fra Windows' egne GPU-tellere per prosess mens hver modell var lastet, og de var like på begge brikkene. Det har to praktiske følger. Et hvilket som helst diskret kort med 4 GB minne rommer selv den største modellen med god margin, så kortets alder betyr mer enn minnestørrelsen. Og integrert grafikk har ikke eget minne: den låner systemets RAM, så på en bærbar med 8 GB tar Best en fjerdedel av det. På en slik maskin er Balansert det hensynsfulle valget; med 16 GB eller mer spiller det ingen rolle.

Hvorfor det ikke finnes en CPU-versjon

Den ene maskinen lokal diktering ikke passer godt for, er en maskin uten brukbar GPU i det hele tatt: en økt via Eksternt skrivebord, en virtuell maskin, en server. Vi bygde en versjon som bare kjørte på prosessoren, og målte den til fem til tjue ganger tregere enn integrert grafikk, noe som gjør en ventetid på to sekunder til et halvt minutt. Vi fjernet den samme dag. Et dikteringsverktøy som i det stille bruker tretti sekunder, er verre enn et som sier rett ut at det trenger en grafikkbrikke, så AlphaDictate ser etter en GPU med Vulkan-driver ved første oppstart og sier fra hvis den ikke finner noen.

I praksis har nesten alle Windows-PC-er som er solgt de siste årene, en slik brikke, integrert eller diskret. Det som som regel står i veien, er en gammel grafikkdriver, og da hjelper det å oppdatere den fra produsentens nettsted.

Hva du bør velge

  • Gaming-PC eller bærbar med et hvilket som helst diskret skjermkort fra NVIDIA eller AMD: Best. Alt tar under et sekund, og du får de mest nøyaktige tekstene.
  • Nyere bærbar med integrert grafikk og 16 GB RAM: Best. Korte passasjer tar omtrent to sekunder og lange knapt mer, takket være deling ved pauser. Balansert hvis du transkriberer mange lange lydopptak.
  • Bærbar med 8 GB RAM: Balansert, eller Rask hvis maskinen er eldre.
  • Eldre integrert grafikk, eller grafikk med lavt strømforbruk: start med Rask. Vi har ikke målt eldre brikker ennå, så se på tallene for integrert grafikk over som den øvre enden av det integrert grafikk klarer.
  • En bærbar med begge brikkene: du trenger ikke å velge. AlphaDictate bruker den diskrete GPU-en når den er tilgjengelig og den integrerte når den diskrete brikken er slått av for å spare strøm, og den bytter mellom dem i pausen mellom to opptak.

Oppsettskjermen i AlphaDictate viser hvilken grafikk den fant, og foreslår en modell å starte med: Best på maskiner med NVIDIA-grafikk, Balansert ellers. Du bytter modell med ett klikk senere, og alle tre er med i prisen, $39/år etter en gratis time. Du kan sjekke hva din egen PC har i Oppgavebehandling under Ytelse, der hver GPU står oppført med minnet sitt.

Har du en GPU vi ikke har målt, særlig en eldre integrert brikke fra Intel eller AMD, tar vi gjerne imot tallene dine på hello@alphadictate.com. Artikkelen vår om diktering til Claude Code bruker de samme målingene sett fra en utviklers side.


Ofte spurt

Trenger jeg et gaming-skjermkort for lokal talegjenkjenning? Nei. På den integrerte grafikken i en bærbar fra 2025 blir et muntlig avsnitt på 15 sekunder transkribert på omtrent to sekunder med Whisper Large v3 og på under et sekund med den minste modellen.

Må jeg vente på at en lang diktering skal transkriberes fra begynnelsen? Nei. Ved hver pause transkriberer AlphaDictate det du har sagt så langt, mens du snakker videre. Etter et minutt med diktering med pauser var ventetiden derfor omtrent to sekunder på integrert grafikk og et halvt sekund på en diskret GPU med den mest nøyaktige modellen.

Hvor mye VRAM trenger Whisper Large v3? Omtrent 2,1 GB i den komprimerte formen AlphaDictate bruker. Whisper Medium trenger omtrent 1,2 GB og Whisper Small omtrent 0,6 GB.

Kan Whisper kjøre på integrert grafikk? Ja, via en Vulkan-driver. Integrert grafikk bruker systemminnet, så minnet modellen trenger, tas fra RAM-en din.

Virker AlphaDictate uten GPU? Nei. Den trenger en grafikkbrikke med Vulkan-driver, integrert eller diskret. En versjon som bare brukte prosessoren, var fem til tjue ganger tregere enn integrert grafikk, så vi leverer ingen slik versjon.

Hvor lang tid tar det å transkribere en time med lyd lokalt? I vår måling omtrent tre minutter på en RTX 5070 Ti for bærbare og omtrent elleve minutter på integrert Radeon 890M-grafikk, med den mest nøyaktige modellen.

Denne artikkelen er maskinoversatt fra engelsk og gjennomgått for mening, ikke av en norsk korrekturleser. Den engelske versjonen er fasiten.