Blog / Welke GPU heb je nodig voor lokaal dicteren? Waarschijnlijk je huidige

Welke GPU heb je nodig voor lokaal dicteren? Waarschijnlijk je huidige

"Draait op je GPU" klinkt alsof je een gaming-pc nodig hebt. Dat is niet zo. We hebben onze eigen dicteerengine getimed op de twee grafische chips in één gewone laptop uit 2025: een losse NVIDIA RTX 5070 Ti laptop-GPU en de AMD Radeon 890M die in de processor is geïntegreerd, het soort graphics dat in de CPU van een middenklasselaptop zit. Beide zetten een gewone gesproken alinea sneller om in tekst dan jij je hand van de toets naar de muis beweegt, en bij lang dicteren verbergt de app het grootste deel van de resterende wachttijd door al te werken terwijl jij praat. Op deze pagina staan de cijfers, het geheugen dat elk model nodig heeft, en het ene soort computer waarop lokaal dicteren niet werkt.

Hoe we hebben gemeten

De audio is een fragment van 77 seconden gesynthetiseerde Engelse spraak over een productoverleg, geknipt in de lengtes die mensen echt dicteren: 5 seconden voor een antwoord in een chat, 15 voor een alinea of een prompt aan een AI-agent, 60 voor een lange e-mail. Elk fragment ging per meetpunt drie keer door precies de engine die AlphaDictate uitlevert, Whisper via whisper.cpp op Vulkan; de tabellen tonen de mediaan. De timer meet alleen de transcriptie, van het moment dat je stopt met praten tot het moment dat de tekst er is, en laat de fractie van een seconde voor het plakken buiten beschouwing. Elke run leverde de volledige transcriptie op, dus de snelle cijfers komen niet doordat de engine audio overslaat.

De drie modellen zijn de drie niveaus van de app: Snel is Whisper Small, Gebalanceerd is Whisper Medium en Beste is Whisper Large v3, alle drie gecomprimeerd tot 5-bits gewichten.

Een gesproken alinea: 15 seconden spraak

Grafische chipSnelGebalanceerdBeste
RTX 5070 Ti laptop-GPU, los0,30 s0,55 s0,77 s
Radeon 890M, geïntegreerd0,64 s1,2 s2,0 s

Op de losse kaart is elk model binnen een seconde klaar, dus er is geen reden om iets anders dan Beste te kiezen. Op geïntegreerde graphics doet het model Beste er ongeveer twee seconden over. Dat merk je, maar bij een e-mail vind je het niet erg; het model Snel blijft onder een seconde en kan duidelijke spraak nog steeds goed aan.

Een lange opname, en waarom je zelden op het geheel wacht

In één stuk getranscribeerd is een minuut spraak het punt waar de twee chips uit elkaar gaan:

60 seconden, in één keerSnelGebalanceerdBeste
RTX 5070 Ti laptop-GPU, los1,6 s2,3 s3,0 s
Radeon 890M, geïntegreerd2,7 s5,4 s9,3 s

Negen seconden wachten na een minuut praten, tien keer per dag, zou irritant zijn. Zover komt het zelden, want AlphaDictate wacht niet tot je klaar bent. Zodra er acht seconden audio is opgenomen en je pauzeert, standaard vijf seconden lang, geeft de app wat je tot dan toe zei aan de GPU en luistert verder. Druk je op stop, dan hoeft alleen het stuk sinds je laatste pauze nog te worden verwerkt. Ononderbroken spraak wordt nooit gesplitst, dus een woord wordt nooit doormidden geknipt.

Om dat te meten, bouwden we een opname zoals mensen echt dicteren: ongeveer een minuut spraak in vier stukken van 13 tot 18 seconden, met telkens een pauze van vijf seconden om na te denken, 74 seconden in totaal. Die speelden we met de echte timing af door de splitslogica van de app zelf, en we maten de wachttijd na stop:

Een minuut dicteren met pauzesSnel, in één keerSnel, gesplitst bij pauzesBeste, in één keerBeste, gesplitst bij pauzes
RTX 5070 Ti laptop-GPU, los1,4 s0,24 s2,8 s0,53 s
Radeon 890M, geïntegreerd3,1 s0,57 s11,0 s2,1 s

Splitsen maakt de wachttijd op beide chips ongeveer vijf keer korter. Met het nauwkeurigste model zijn geïntegreerde graphics na een minuut dicteren in ongeveer twee seconden klaar, even snel als bij één alinea, omdat er bij het stoppen alleen je laatste alinea nog over is.

Ons eigen gebruik van de app op deze laptop vertelt hetzelfde verhaal. In de afgelopen week dat we ermee dicteerden, had ongeveer de helft van de opnames van meer dan 20 seconden een pauze die lang genoeg was om te splitsen. Bij die opnames bleef na stop een mediaan van 13 seconden spraak over om te transcriberen, en de mediane wachttijd was 0,8 seconde. Lange opnames zonder zo'n pauze wachtten een mediaan van 1,7 seconde. De pauzeduur is een instelling, "Pauze die een deel afsluit" onder "Nauwkeurigheid & snelheid", en kan omlaag tot twee seconden als je sneller resultaat wilt en zonder aarzelen spreekt.

Een geluidsopname: een bestand van 10 minuten

Grafische chipSnelBeste
RTX 5070 Ti laptop-GPU, los16 s28 s
Radeon 890M, geïntegreerd36 s1 min 54 s

Bestanden krijgen geen voorsprong, want de hele opname is er al voordat de transcriptie begint. Hier verdient een losse GPU zich dus terug. De opname van een vergadering van een uur kost op de losse kaart met het beste model ongeveer drie minuten; op geïntegreerde graphics ongeveer elf. Beide zijn beter dan een uur van een vertrouwelijke vergadering naar een clouddienst sturen en wachten tot de tekst terugkomt.

Hoeveel geheugen elk model nodig heeft

ModelGebruikt GPU-geheugen
Snelongeveer 0,6 GB
Gebalanceerdongeveer 1,2 GB
Besteongeveer 2,1 GB

We lazen deze waarden af uit de eigen GPU-tellers per proces van Windows terwijl elk model geladen was, en ze waren op beide chips gelijk. Dat heeft twee praktische gevolgen. Elke losse kaart met 4 GB geheugen biedt zelfs voor het grootste model ruim plaats, dus de leeftijd van de kaart telt zwaarder dan de hoeveelheid geheugen. En geïntegreerde graphics hebben geen eigen geheugen: ze lenen werkgeheugen van het systeem, dus op een laptop met 8 GB neemt het model Beste daar een kwart van in. Op zo'n computer is Gebalanceerd de keuze die ruimte overlaat; met 16 GB of meer maakt het niet uit.

Waarom er geen CPU-versie is

Het ene soort computer waarop lokaal dicteren niet goed werkt, is een computer zonder bruikbare GPU: een sessie via Extern bureaublad, een virtuele machine, een server. We bouwden een versie die alleen op de processor draaide en maten dat die vijf tot twintig keer trager was dan geïntegreerde graphics, waardoor twee seconden wachten een halve minuut wordt. We hebben hem dezelfde dag weer verwijderd. Een dicteertool die stilletjes dertig seconden nodig heeft, is slechter dan een die je eerlijk zegt dat hij een grafische chip nodig heeft. Daarom controleert AlphaDictate bij de eerste start of er een GPU met een Vulkan-stuurprogramma is, en meldt het als die er niet is.

In de praktijk heeft bijna elke Windows-pc die de afgelopen jaren is verkocht er een, geïntegreerd of los. Wat meestal in de weg zit, is een oud grafisch stuurprogramma, en dat los je op door het bij te werken via de site van de fabrikant.

Wat kies je

  • Gaming-pc of -laptop met een losse kaart van NVIDIA of AMD, welke dan ook: Beste. Alles blijft onder een seconde, en je krijgt de nauwkeurigste transcripties.
  • Recente laptop met geïntegreerde graphics en 16 GB RAM: Beste. Korte stukken duren ongeveer twee seconden en lange nauwelijks langer, dankzij het splitsen bij pauzes. Gebalanceerd als je veel lange opnames transcribeert.
  • Laptop met 8 GB RAM: Gebalanceerd, of Snel als de computer ouder is.
  • Oudere of zuinige geïntegreerde graphics: begin met Snel. We hebben oudere chips nog niet gemeten, dus zie de cijfers voor geïntegreerde graphics hierboven als de bovengrens van wat geïntegreerde graphics kunnen.
  • Een laptop met beide chips: je hoeft niet te kiezen. AlphaDictate gebruikt de losse GPU als die beschikbaar is en de geïntegreerde als de losse chip is uitgeschakeld om stroom te besparen, en het wisselt tussen de twee in de pauze tussen opnames.

Bij de eerste start noemt AlphaDictate de graphics die het heeft gevonden en stelt het een model voor om mee te beginnen: Beste op computers met NVIDIA-graphics, Gebalanceerd op de rest. Later wissel je met één klik van model, en alle drie zitten bij de prijs inbegrepen: $39/jaar na een gratis uur. Wat je eigen pc heeft, zie je in Taakbeheer onder Prestaties, waar elke GPU met zijn geheugen staat.

Heb je een GPU die wij nog niet hebben gemeten, vooral een oudere geïntegreerde chip van Intel of AMD, dan horen we graag je cijfers via hello@alphadictate.com. Ons stuk over dicteren in Claude Code gebruikt dezelfde metingen, bekeken door de ogen van een ontwikkelaar.


Veelgestelde vragen

Heb ik een gaming-GPU nodig voor lokale spraakherkenning? Nee. Op de geïntegreerde graphics van een laptop uit 2025 wordt een gesproken alinea van 15 seconden met Whisper Large v3 in ongeveer twee seconden getranscribeerd, en met het kleinste model in minder dan een seconde.

Moet ik bij een lang dictaat wachten tot alles vanaf het begin is getranscribeerd? Nee. AlphaDictate transcribeert bij elke pauze wat je hebt gezegd terwijl je doorpraat. Na een minuut dicteren met pauzes was de wachttijd met het nauwkeurigste model ongeveer twee seconden op geïntegreerde graphics en een halve seconde op een losse GPU.

Hoeveel VRAM heeft Whisper Large v3 nodig? Ongeveer 2,1 GB in de gecomprimeerde vorm die AlphaDictate gebruikt. Whisper Medium heeft ongeveer 1,2 GB nodig en Whisper Small ongeveer 0,6 GB.

Kan Whisper op geïntegreerde graphics draaien? Ja, via een Vulkan-stuurprogramma. Geïntegreerde graphics gebruiken het systeemgeheugen, dus het geheugen voor het model gaat van je RAM af.

Werkt AlphaDictate zonder GPU? Nee. Het heeft een grafische chip met een Vulkan-stuurprogramma nodig, geïntegreerd of los. Een versie die alleen de processor gebruikte, was vijf tot twintig keer trager dan geïntegreerde graphics, dus die leveren we niet.

Hoe lang duurt het om een uur audio lokaal te transcriberen? In onze meting met het nauwkeurigste model ongeveer drie minuten op een RTX 5070 Ti voor laptops en ongeveer elf minuten op de geïntegreerde graphics van een Radeon 890M.

Dit artikel is machinaal uit het Engels vertaald en op begrijpelijkheid nagekeken, niet door een moedertaalspreker. De Engelse versie is leidend.