Blog / De que GPU você precisa para ditado local? Provavelmente da que já tem

De que GPU você precisa para ditado local? Provavelmente da que já tem

"Roda na sua GPU" parece exigir um PC gamer. Não exige. Cronometramos o nosso próprio motor de ditado nos dois chips gráficos de um notebook comum de 2025: uma GPU dedicada NVIDIA RTX 5070 Ti de notebook e a AMD Radeon 890M integrada ao processador, o tipo de gráfico que vem dentro da CPU de um notebook intermediário. As duas transformam um parágrafo falado típico em texto mais rápido do que você consegue levar a mão da tecla até o mouse e, nos ditados longos, o app esconde a maior parte da espera restante trabalhando enquanto você fala. Esta página traz os números, a memória de que cada modelo precisa e o único tipo de máquina em que o ditado local não funciona.

Como medimos

O áudio é um clipe de 77 segundos de fala sintetizada em inglês sobre uma reunião de produto, cortado nas durações que as pessoas realmente ditam: 5 segundos para uma resposta de chat, 15 para um parágrafo ou um prompt para um agente de IA, 60 para um e-mail longo. Cada clipe passou pelo mesmo motor que o AlphaDictate distribui, o Whisper rodando pelo whisper.cpp sobre Vulkan, três vezes para cada medição; as tabelas mostram a mediana. O cronômetro cobre só a transcrição, do momento em que você para de falar até o momento em que o texto existe, e deixa de fora a fração de segundo que a colagem leva. Todas as execuções devolveram a transcrição completa, então os números rápidos não são o motor pulando áudio.

Os três modelos são os três níveis do app: Rápido é o Whisper Small, Equilibrado é o Whisper Medium e Melhor é o Whisper Large v3, todos comprimidos para pesos de 5 bits.

Um parágrafo falado: 15 segundos de fala

Placa de vídeoRápidoEquilibradoMelhor
GPU RTX 5070 Ti de notebook, dedicada0,30 s0,55 s0,77 s
Radeon 890M, integrada0,64 s1,2 s2,0 s

Na placa dedicada, todos os modelos terminam em menos de um segundo, então não há motivo para escolher outro que não o Melhor. Na GPU integrada, o Melhor leva cerca de dois segundos, o que você nota, mas não incomoda num e-mail; o Rápido fica abaixo de um segundo e ainda lida bem com fala clara.

Uma gravação longa, e por que você raramente espera por ela inteira

Transcrito de uma vez só, um minuto de fala é onde os dois chips se separam:

60 segundos, tudo de uma vezRápidoEquilibradoMelhor
GPU RTX 5070 Ti de notebook, dedicada1,6 s2,3 s3,0 s
Radeon 890M, integrada2,7 s5,4 s9,3 s

Nove segundos de espera depois de um minuto falando irritariam dez vezes por dia. Raramente se chega a isso, porque o AlphaDictate não espera você terminar. Assim que ele tem oito segundos de áudio e você faz uma pausa, de cinco segundos por padrão, ele entrega à GPU o que você disse até ali e continua ouvindo. Quando você manda parar, só falta a parte desde a sua última pausa. A fala contínua nunca é dividida, então nenhuma palavra é cortada ao meio.

Para medir isso, montamos uma gravação do jeito que as pessoas realmente ditam: cerca de um minuto de fala em quatro trechos de 13 a 18 segundos, com uma pausa de cinco segundos para pensar entre eles, 74 segundos no total. Reproduzimos essa gravação pela própria lógica de divisão do app, no tempo real dela, e cronometramos a espera depois de parar:

Um minuto de ditado com pausasRápido, tudo de uma vezRápido, dividido nas pausasMelhor, tudo de uma vezMelhor, dividido nas pausas
GPU RTX 5070 Ti de notebook, dedicada1,4 s0,24 s2,8 s0,53 s
Radeon 890M, integrada3,1 s0,57 s11,0 s2,1 s

A divisão reduz a espera a cerca de um quinto nos dois chips. Com o modelo mais preciso, a GPU integrada responde a um minuto de ditado em cerca de dois segundos, o mesmo que a um único parágrafo, porque, quando você para, só resta o seu último parágrafo.

O nosso próprio uso do app neste notebook conta a mesma história. Na última semana ditando com ele, cerca de metade das gravações com mais de 20 segundos teve uma pausa longa o bastante para a divisão. Nessas, restava uma mediana de 13 segundos de fala para transcrever depois de parar, e a espera mediana foi de 0,8 segundo. As gravações longas faladas sem uma pausa assim esperaram uma mediana de 1,7 segundo. A duração da pausa é uma configuração, Pausa que termina uma parte, em Precisão e velocidade, e pode baixar até dois segundos se você quer resultados mais cedo e fala sem hesitar.

Um arquivo de áudio de 10 minutos

Placa de vídeoRápidoMelhor
GPU RTX 5070 Ti de notebook, dedicada16 s28 s
Radeon 890M, integrada36 s1 min 54 s

Arquivos não têm essa vantagem, já que a gravação inteira está pronta antes de a transcrição começar, então é aqui que uma GPU dedicada mostra o seu valor. A gravação de uma reunião de uma hora, na placa dedicada e com o modelo Melhor, leva cerca de três minutos; na GPU integrada, cerca de onze. As duas opções ganham de enviar uma hora de reunião confidencial para um serviço em nuvem e esperar que ela volte.

De quanta memória cada modelo precisa

ModeloMemória de GPU usada
Rápidocerca de 0,6 GB
Equilibradocerca de 1,2 GB
Melhorcerca de 2,1 GB

Lemos esses valores nos próprios contadores de GPU por processo do Windows com cada modelo carregado, e eles foram iguais nos dois chips. Há duas consequências práticas. Qualquer placa dedicada com 4 GB de memória comporta até o maior modelo com folga, então a idade da placa importa mais do que a memória dela. E as GPUs integradas não têm memória própria: elas pegam emprestada a RAM do sistema, então, num notebook com 8 GB, o Melhor ocupa um quarto dela. Numa máquina assim, o Equilibrado é a escolha sensata; com 16 GB ou mais, tanto faz.

Por que não existe uma versão para CPU

A única máquina que o ditado local não atende bem é uma máquina sem nenhuma GPU utilizável: uma sessão de Área de Trabalho Remota, uma máquina virtual, um servidor. Construímos uma versão que rodava só no processador e medimos que ela era de cinco a vinte vezes mais lenta do que a GPU integrada, o que transforma uma espera de dois segundos em meio minuto. Removemos essa versão no mesmo dia. Uma ferramenta de ditado que leva trinta segundos sem avisar é pior do que uma que diz claramente que precisa de um chip gráfico, então o AlphaDictate procura uma GPU com driver Vulkan no primeiro uso e avisa se não encontrar.

Na prática, quase todo PC com Windows vendido nos últimos anos tem uma, integrada ou dedicada. O que costuma atrapalhar é um driver de vídeo antigo, e atualizá-lo pelo site do fabricante resolve.

O que escolher

  • PC ou notebook gamer com qualquer placa dedicada NVIDIA ou AMD: Melhor. Tudo fica abaixo de um segundo, e você tem as transcrições mais precisas.
  • Notebook recente com GPU integrada e 16 GB de RAM: Melhor. Trechos curtos levam cerca de dois segundos e os longos quase nada a mais, graças à divisão nas pausas. Equilibrado, se você transcreve muitas gravações longas.
  • Notebook com 8 GB de RAM: Equilibrado, ou Rápido se a máquina for mais antiga.
  • GPU integrada antiga ou de baixo consumo: comece pelo Rápido. Ainda não medimos chips mais antigos, então trate os números de GPU integrada acima como o teto do que uma GPU integrada consegue.
  • Um notebook com os dois chips: você não precisa escolher. O AlphaDictate usa a GPU dedicada quando ela está disponível e a integrada quando o chip dedicado é desligado para economizar energia, e troca entre elas na pausa entre uma gravação e outra.

A tela de configuração do AlphaDictate mostra o nome da placa de vídeo que encontrou e sugere um modelo inicial: Melhor em máquinas com placa NVIDIA, Equilibrado nas demais. Depois, o modelo se troca com um clique, e os três estão incluídos no preço, 39 $ por ano depois de uma hora grátis. Você pode ver o que o seu PC tem no Gerenciador de Tarefas, em Desempenho, onde cada GPU aparece com a sua memória.

Se você tem uma GPU que ainda não medimos, principalmente um chip integrado Intel ou AMD mais antigo, gostaríamos de receber os seus números em hello@alphadictate.com. A nossa nota sobre ditar para o Claude Code usa as mesmas medições do ponto de vista de um desenvolvedor.


Perguntas frequentes

Preciso de uma GPU gamer para reconhecimento de fala local? Não. Na GPU integrada de um notebook de 2025, um parágrafo falado de 15 segundos é transcrito em cerca de dois segundos com o Whisper Large v3 e em menos de um segundo com o menor modelo.

Preciso esperar que um ditado longo seja transcrito desde o começo? Não. O AlphaDictate transcreve o que você disse a cada pausa enquanto você continua falando, então, depois de um minuto de ditado com pausas, a espera foi de cerca de dois segundos na GPU integrada e de meio segundo numa GPU dedicada, com o modelo mais preciso.

De quanta VRAM o Whisper Large v3 precisa? Cerca de 2,1 GB na forma comprimida que o AlphaDictate usa. O Whisper Medium precisa de cerca de 1,2 GB, e o Whisper Small, de cerca de 0,6 GB.

O Whisper roda em GPU integrada? Sim, por meio de um driver Vulkan. As GPUs integradas usam a memória do sistema, então a memória do modelo sai da sua RAM.

O AlphaDictate funciona sem GPU? Não. Ele precisa de um chip gráfico com driver Vulkan, integrado ou dedicado. Uma versão só para processador era de cinco a vinte vezes mais lenta do que uma GPU integrada, então não a distribuímos.

Quanto tempo leva para transcrever uma hora de áudio localmente? Na nossa medição, cerca de três minutos numa RTX 5070 Ti de notebook e cerca de onze minutos na GPU integrada Radeon 890M, com o modelo mais preciso.

Este artigo foi traduzido do inglês por máquina e revisado quanto ao sentido, mas não por um revisor nativo. A versão em inglês é a referência.