Blog / Quale GPU serve per la dettatura locale? Probabilmente quella che hai

Quale GPU serve per la dettatura locale? Probabilmente quella che hai

«Gira sulla tua GPU» fa pensare che serva un PC da gaming. Non è così. Abbiamo cronometrato il nostro motore di dettatura sui due chip grafici di un normale portatile del 2025: una GPU dedicata NVIDIA RTX 5070 Ti per portatili e la AMD Radeon 890M integrata nel suo processore, il tipo di grafica che si trova dentro la CPU di un portatile di fascia media. Entrambe trasformano un tipico paragrafo parlato in testo prima che tu riesca a spostare la mano dal tasto al mouse, e nelle dettature lunghe l'app nasconde gran parte dell'attesa restante lavorando mentre parli. Qui trovi i numeri, la memoria che serve a ciascun modello e l'unico tipo di computer su cui la dettatura locale non funziona.

Come abbiamo misurato

L'audio è una clip di 77 secondi di parlato inglese sintetizzato su una riunione di prodotto, tagliata nelle durate che le persone dettano davvero: 5 secondi per una risposta in chat, 15 per un paragrafo o un prompt per un agente di IA, 60 per un'e-mail lunga. Ogni clip è passata tre volte per ciascun punto nello stesso motore che distribuisce AlphaDictate, Whisper eseguito tramite whisper.cpp su Vulkan; le tabelle riportano la mediana. Il cronometro copre solo la trascrizione, dal momento in cui smetti di parlare al momento in cui il testo esiste, e non include la frazione di secondo che richiede l'incolla. Ogni esecuzione ha restituito la trascrizione completa, quindi i tempi rapidi non dipendono da un motore che salta pezzi di audio.

I tre modelli sono i tre livelli dell'app: Veloce è Whisper Small, Bilanciato è Whisper Medium e Migliore è Whisper Large v3, tutti compressi con pesi a 5 bit.

Un paragrafo parlato: 15 secondi di voce

Scheda graficaVeloceBilanciatoMigliore
GPU RTX 5070 Ti per portatili, dedicata0,30 s0,55 s0,77 s
Radeon 890M, integrata0,64 s1,2 s2,0 s

Sulla scheda dedicata ogni modello finisce in meno di un secondo, quindi non c'è motivo di scegliere altro che Migliore. Sulla grafica integrata il modello Migliore impiega circa due secondi, che si notano ma per un'e-mail non danno fastidio; il modello Veloce sta sotto il secondo e se la cava ancora bene con un parlato chiaro.

Una dettatura lunga, e perché raramente la aspetti tutta

Trascritto in un solo blocco, un minuto di parlato è il punto in cui i due chip si separano:

60 secondi in un solo bloccoVeloceBilanciatoMigliore
GPU RTX 5070 Ti per portatili, dedicata1,6 s2,3 s3,0 s
Radeon 890M, integrata2,7 s5,4 s9,3 s

Nove secondi dopo un minuto di parlato, dieci volte al giorno, sarebbero irritanti. Raramente si arriva a tanto, perché AlphaDictate non aspetta che tu finisca. Quando ha almeno otto secondi di audio e fai una pausa, di cinque secondi per impostazione predefinita, passa alla GPU ciò che hai detto fin lì e continua ad ascoltare. Quando premi stop, resta da fare solo la parte successiva all'ultima pausa. Il parlato senza interruzioni non viene mai diviso, quindi una parola non viene mai tagliata a metà.

Per misurarlo abbiamo costruito una dettatura come la fanno davvero le persone: circa un minuto di parlato in quattro tratti da 13 a 18 secondi, con una pausa di cinque secondi per pensare tra l'uno e l'altro, 74 secondi in tutto. L'abbiamo riprodotta con la stessa logica di suddivisione dell'app, rispettando i tempi reali, e abbiamo cronometrato l'attesa dopo lo stop:

Un minuto di dettatura con pauseVeloce, in un solo bloccoVeloce, divisa alle pauseMigliore, in un solo bloccoMigliore, divisa alle pause
GPU RTX 5070 Ti per portatili, dedicata1,4 s0,24 s2,8 s0,53 s
Radeon 890M, integrata3,1 s0,57 s11,0 s2,1 s

La suddivisione riduce l'attesa di circa cinque volte su entrambi i chip. Con il modello più preciso, la grafica integrata restituisce un minuto di dettatura in circa due secondi, come un singolo paragrafo, perché quando ti fermi resta solo il tuo ultimo paragrafo.

Anche il nostro uso dell'app su questo portatile racconta la stessa storia. Nell'ultima settimana di dettature, circa la metà di quelle più lunghe di 20 secondi conteneva una pausa abbastanza lunga da poterle dividere. In quei casi, dopo lo stop restavano da trascrivere in mediana 13 secondi di parlato, e l'attesa mediana è stata di 0,8 secondi. Le dettature lunghe senza una pausa del genere hanno atteso in mediana 1,7 secondi. La durata della pausa è un'impostazione, Pausa che chiude una parte in Precisione e velocità, e può scendere fino a due secondi se vuoi i risultati prima e parli senza esitazioni.

Una registrazione: un file di 10 minuti

Scheda graficaVeloceMigliore
GPU RTX 5070 Ti per portatili, dedicata16 s28 s
Radeon 890M, integrata36 s1 min 54 s

I file non hanno alcun vantaggio di partenza, perché la registrazione è già tutta lì prima che inizi la trascrizione, ed è qui che una GPU dedicata si guadagna il suo posto. La registrazione di una riunione di un'ora sulla scheda dedicata con il modello Migliore richiede circa tre minuti; sulla grafica integrata, circa undici. In entrambi i casi è meglio che mandare un'ora di riunione riservata a un servizio cloud e aspettare che torni indietro.

Quanta memoria serve a ciascun modello

ModelloMemoria GPU usata
Velocecirca 0,6 GB
Bilanciatocirca 1,2 GB
Migliorecirca 2,1 GB

Abbiamo letto questi valori dai contatori GPU per processo di Windows mentre ciascun modello era caricato, ed erano gli stessi su entrambi i chip. Due conseguenze pratiche. Qualsiasi scheda dedicata con 4 GB di memoria contiene anche il modello più grande con spazio in abbondanza, quindi conta più l'età della scheda che la quantità di memoria. E la grafica integrata non ha memoria propria: prende in prestito la RAM di sistema, quindi su un portatile con 8 GB il modello Migliore ne occupa un quarto. Su un computer così, Bilanciato è la scelta più ragionevole; con 16 GB o più non fa differenza.

Perché non esiste una versione per CPU

L'unico computer che la dettatura locale non serve bene è quello senza alcuna GPU utilizzabile: una sessione di desktop remoto, una macchina virtuale, un server. Abbiamo costruito una versione che girava solo sul processore e l'abbiamo misurata: da cinque a venti volte più lenta della grafica integrata, il che trasforma un'attesa di due secondi in mezzo minuto. L'abbiamo tolta il giorno stesso. Uno strumento di dettatura che impiega trenta secondi senza dirti niente è peggio di uno che ti dice chiaramente che ha bisogno di un chip grafico, quindi AlphaDictate al primo avvio cerca una GPU con driver Vulkan e ti avvisa se non la trova.

In pratica quasi tutti i PC Windows venduti negli ultimi anni ne hanno una, integrata o dedicata. Di solito l'ostacolo è un driver grafico vecchio, e basta aggiornarlo dal sito del produttore.

Che cosa scegliere

  • PC o portatile da gaming con una qualsiasi scheda dedicata NVIDIA o AMD: Migliore. Tutto sta sotto il secondo e ottieni le trascrizioni più precise.
  • Portatile recente con grafica integrata e 16 GB di RAM: Migliore. I brani brevi richiedono circa due secondi e quelli lunghi poco di più, grazie alla suddivisione alle pause. Bilanciato se trascrivi molte registrazioni lunghe.
  • Portatile con 8 GB di RAM: Bilanciato, oppure Veloce se il computer è più vecchio.
  • Grafica integrata più vecchia o a basso consumo: parti da Veloce. Non abbiamo ancora misurato i chip più vecchi, quindi considera i numeri della grafica integrata qui sopra come il limite superiore di ciò che può fare una grafica integrata.
  • Un portatile con entrambi i chip: non devi scegliere. AlphaDictate usa la GPU dedicata quando è disponibile e quella integrata quando il chip dedicato è spento per risparmiare energia, e passa dall'una all'altra nella pausa tra una dettatura e l'altra.

La schermata di configurazione di AlphaDictate indica la grafica che ha trovato e suggerisce un modello di partenza: Migliore sui computer con grafica NVIDIA, Bilanciato altrove. In seguito il modello si cambia con un clic, e tutti e tre sono inclusi nel prezzo, 39 $ all'anno dopo un'ora gratuita. Puoi controllare che cosa ha il tuo PC in Gestione attività, alla voce Prestazioni, dove ogni GPU è elencata con la sua memoria.

Se hai una GPU che non abbiamo misurato, soprattutto un vecchio chip integrato Intel o AMD, ci farebbe piacere ricevere i tuoi numeri a hello@alphadictate.com. Il nostro articolo su come dettare a Claude Code usa le stesse misure dal punto di vista di uno sviluppatore.


Domande frequenti

Mi serve una GPU da gaming per il riconoscimento vocale in locale? No. Sulla grafica integrata di un portatile del 2025, un paragrafo parlato di 15 secondi viene trascritto in circa due secondi con Whisper Large v3 e in meno di un secondo con il modello più piccolo.

Devo aspettare che una dettatura lunga venga trascritta dall'inizio? No. AlphaDictate trascrive ciò che hai detto a ogni pausa mentre continui a parlare, quindi dopo un minuto di dettatura con pause l'attesa è stata di circa due secondi sulla grafica integrata e di mezzo secondo su una GPU dedicata, con il modello più preciso.

Quanta VRAM serve a Whisper Large v3? Circa 2,1 GB nella forma compressa che usa AlphaDictate. Whisper Medium richiede circa 1,2 GB e Whisper Small circa 0,6 GB.

Whisper può girare su una grafica integrata? Sì, tramite un driver Vulkan. La grafica integrata usa la memoria di sistema, quindi la memoria del modello viene sottratta alla tua RAM.

AlphaDictate funziona senza GPU? No. Richiede un chip grafico con driver Vulkan, integrato o dedicato. Una versione solo per processore era da cinque a venti volte più lenta della grafica integrata, quindi non la distribuiamo.

Quanto tempo serve per trascrivere un'ora di audio in locale? Nella nostra misurazione, circa tre minuti su una RTX 5070 Ti per portatili e circa undici minuti su una grafica integrata Radeon 890M, con il modello più preciso.

Questo articolo è stato tradotto dall'inglese da una macchina e controllato nel significato, ma non da un revisore madrelingua. La versione inglese fa fede.