Blog / Ditado no Claude Code no Windows

Ditado no Claude Code no Windows: o que o /voice envia e uma via local

Conversar com um agente de programação é o primeiro tipo de ditado que muitos desenvolvedores já tiveram vontade de usar. Os prompts são longos, coloquiais e cheios de frases como "refatore o middleware de autenticação", e digitá-los é mais lento do que dizê-los. O Claude Code agora vem com um modo de voz, e ele é bom. Este artigo explica exatamente o que ele faz com o seu áudio, onde ele para, e traz números medidos da alternativa: uma tecla de ditado que funciona em todos os terminais, caixas de chat e editores da máquina, com o modelo de fala rodando na sua própria GPU.

O que o modo de voz do Claude Code faz

Você o ativa com /voice. No modo padrão, hold, você segura a barra de espaço enquanto fala; no modo tap, você toca uma vez para começar e outra para enviar. A transcrição aparece no prompt enquanto você fala, esmaecida até ficar definitiva, e dá para misturar digitação e fala na mesma mensagem. A gravação para sozinha depois de quinze segundos de silêncio ou de dois minutos no total. A transcrição é ajustada para vocabulário de programação, e o Claude Code acrescenta discretamente o nome do seu projeto e o branch do git como dicas de reconhecimento, um toque inteligente. E não consome nada dos seus limites de uso.

Agora, a parte que a própria documentação da Anthropic afirma logo no primeiro requisito, palavra por palavra: "O ditado por voz transmite o áudio gravado para os servidores da Anthropic para transcrição. O áudio não é processado localmente" (no original: "Voice dictation streams your recorded audio to Anthropic's servers for transcription. Audio is not processed locally."). Três consequências decorrem dessa frase e estão explicadas na mesma página.

  • Exige uma conta do claude.ai. O serviço de fala não está disponível quando o Claude Code roda com uma chave de API, Amazon Bedrock, Agent Platform do Google Cloud ou Microsoft Foundry. Empresas que escolheram esses caminhos por questões de residência de dados ficam sem modo de voz, o que é coerente, ainda que inconveniente.
  • Exige um microfone local. Não há voz em sessões SSH, no Claude Code na web, no VS Code Remote, em Dev Containers ou no Codespaces, nem no WSL1.
  • Entende vinte idiomas, um de cada vez. O ditado segue a configuração language e usa o inglês por padrão. Defina português e você dita em português; fale português com a configuração em inglês e a transcrição sai sem sentido, como observa a seção de solução de problemas. Não há detecção automática.

Nada disso é uma crítica à engenharia. É a descrição de uma arquitetura: um serviço de transcrição em nuvem muito bom, embutido em um único aplicativo, disponível para um único tipo de conta.

Onde ele para no dia a dia de um desenvolvedor

As condições de conta e de rede importam para algumas pessoas e não para outras. Dois limites atingem todo mundo.

Só funciona dentro do prompt do Claude Code. No momento em que você muda para uma sessão do Codex, um chat do Cursor, uma issue do GitHub no navegador, uma mensagem de commit no seu editor ou uma thread do Slack, a voz some. Quem conversa com agentes raramente conversa com um só.

O áudio sai da máquina. Num projeto pessoal, isso não preocupa ninguém. No código de um cliente sob NDA, num empregador de setor regulado ou simplesmente para um desenvolvedor que escolheu modelos locais por algum motivo, é uma linha que não se cruza. Algumas organizações já desativaram o recurso por política interna, e o Claude Code informa isso com a mensagem "Voice mode is disabled by your organization's policy".

A alternativa local, medida

Uma tecla de ditado que vale para o sistema inteiro contorna os dois limites: pressione em qualquer janela, fale, pressione de novo, e o texto aparece onde estava o cursor, transcrito por um modelo Whisper na sua própria placa de vídeo. A pergunta óbvia é se a transcrição local é rápida o bastante para parecer uma conversa. Medimos o nosso próprio motor, o que roda dentro do AlphaDictate, no notebook em que este artigo foi escrito, que tem uma GPU dedicada NVIDIA RTX 5070 Ti de notebook e uma AMD Radeon 890M integrada. O áudio é um clipe de 77 segundos de fala sintetizada em inglês sobre uma reunião de produto, cortado nas durações típicas de uma gravação; cada número é a mediana de três execuções no motor que distribuímos e não inclui a fração de segundo que a própria colagem leva.

Duração da gravaçãoRápido, GPU dedicadaMelhor, GPU dedicadaRápido, GPU integradaMelhor, GPU integrada
5 segundos0,13 s0,29 s0,31 s1,2 s
15 segundos0,30 s0,77 s0,64 s2,0 s
60 segundos1,6 s3,0 s2,7 s9,3 s

Carregar um modelo na GPU acontece uma vez só e levou entre um e dois segundos e meio, conforme o tamanho. Um prompt típico para um agente tem de dez a vinte segundos de fala, então, numa GPU dedicada, o texto aparece menos de um segundo depois de você parar de falar, com o modelo mais preciso, e numa GPU integrada em cerca de dois segundos, ou bem abaixo de um segundo se você escolher o modelo Rápido. O ditado em nuvem não é significativamente mais rápido do que isso quando se conta a ida e volta, e o ditado local não fica mais lento quando a conexão é ruim.

As gravações mais longas raramente esperam nem isso: o AlphaDictate transcreve o que você já disse a cada pausa enquanto você continua falando, então, depois de um minuto de ditado com pausas, só resta o último trecho, cerca de meio segundo na GPU dedicada e dois segundos na integrada, com o modelo mais preciso. O nosso artigo sobre GPUs traz esses números.

Duas ressalvas honestas. A fala sintetizada é mais limpa do que uma pessoa murmurando para o microfone de um notebook, então este teste não mede a precisão; mede a latência. E a coluna da GPU integrada é de um notebook de 2025; gráficos integrados mais antigos serão mais lentos, e é por isso que o app oferece três tamanhos de modelo e diz, no primeiro uso, qual deles o seu hardware suporta.

O problema do terminal que ninguém menciona

Toda ferramenta de ditado no Windows, incluindo a nossa, coloca o texto num terminal do mesmo jeito: põe a transcrição na área de transferência e envia um comando de colar. O Windows Terminal, o terminal do VS Code e o console em que o Claude Code roda aceitam Ctrl+V, então isso funciona. Duas coisas quebram esse caminho, e quebram para todas as ferramentas.

A primeira é um terminal com privilégios elevados. Se você roda o shell como administrador, o Windows descarta em silêncio as teclas injetadas por um programa com privilégios normais, e a colagem parece não fazer nada, sem erro em lugar nenhum. O AlphaDictate verifica isso antes de colar e avisa que o texto está na área de transferência para você mesmo pressionar Ctrl+V, em vez de perder a gravação. A segunda é a própria área de transferência: a colagem substitui o que você tinha copiado. Escolhemos deixar a transcrição na área de transferência de propósito, para que uma colagem que falhou por qualquer motivo esteja a um Ctrl+V de distância, e toda gravação também fica guardada no histórico local do app. Se você ditar enquanto tinha algo importante copiado, copie de novo depois. Essa é a troca, e preferimos dizer isso aqui a deixar você descobrir sozinho.

Como configurar uma tecla de ditado local para trabalhar com agentes

  1. Instale um app de ditado local e deixe-o baixar um modelo. Escolha o modelo Rápido se você tem gráficos integrados e quer resultados em menos de um segundo; escolha o Melhor numa GPU dedicada.
  2. Associe o ditado a algo que você alcança sem olhar. Um botão lateral do mouse é ideal para trabalhar com agentes: mão no mouse, pressiona, fala, pressiona, e o prompt se preenche.
  3. Deixe o idioma na detecção automática se você pensa em mais de um idioma. O Whisper acompanha você no meio da frase.
  4. Acrescente uma vez as palavras incomuns do seu projeto à sugestão de vocabulário: nomes de serviços internos, a biblioteca que você vive citando, o sobrenome do seu cofundador.
  5. Mantenha também o modo de voz do Claude Code ativado, se você gosta da digitação com prévia ao vivo. Os dois não entram em conflito; um é uma tecla dentro de um aplicativo, o outro é uma tecla que funciona em todo lugar.

Nós fazemos o AlphaDictate, então leia a recomendação com isso em mente, e saiba que a alternativa gratuita na mesma categoria é o Handy, um app de ditado local de código aberto, com menos recursos e sem custo. A nossa nota anterior sobre a digitação por voz do Windows trata da opção que já vem no sistema, que também envia o áudio para um servidor e também fica limitada a um idioma.


Perguntas frequentes

O modo de voz do Claude Code processa o áudio localmente? Não. A documentação da Anthropic diz que o áudio é transmitido para os servidores da Anthropic para transcrição e não é processado localmente.

Por que o /voice diz que exige uma conta do Claude.ai? O serviço de conversão de fala em texto só é oferecido para quem faz login no claude.ai. Sessões do Claude Code autenticadas com chave de API, Bedrock, Agent Platform do Google Cloud ou Microsoft Foundry não podem usá-lo.

Dá para ditar para o Claude Code via SSH? Não com o modo de voz embutido, que precisa de um microfone local. Um app de ditado para o sistema inteiro, rodando na sua máquina local, digita no terminal SSH como em qualquer outra janela.

Quais idiomas o modo de voz do Claude Code suporta? Vinte, incluindo inglês, alemão, francês, espanhol, português, polonês, japonês, coreano e ucraniano, escolhidos pela configuração de idioma, não detectados.

Quão rápido é o ditado local num notebook? No notebook que medimos, uma gravação de quinze segundos foi transcrita em menos de um segundo na GPU dedicada com o modelo mais preciso, e em cerca de dois segundos na GPU integrada, ou em menos de um segundo com o modelo Rápido.

O ditado funciona num terminal aberto como administrador? No Windows, janelas com privilégios elevados ignoram colagens injetadas, qualquer que seja a ferramenta. O AlphaDictate detecta isso e deixa o texto na área de transferência para um Ctrl+V manual.

Este artigo foi traduzido do inglês por máquina e revisado quanto ao sentido, mas não por um revisor nativo. A versão em inglês é a referência.