Blog / Dictar a Claude Code en Windows

Dictar a Claude Code en Windows: qué envía /voice y una vía local

Hablar con un agente de programación es, para muchos desarrolladores, la primera vez que de verdad han querido dictar algo. Los prompts son largos, conversacionales y están llenos de frases como «refactoriza el middleware de autenticación», y escribirlos cuesta más que decirlos. Claude Code ya trae un modo de voz, y es bueno. Este artículo explica exactamente qué hace con tu audio y dónde se para, y da cifras medidas de la alternativa: una tecla de dictado que funciona en cualquier terminal, chat o editor del equipo, con el modelo de voz ejecutándose en tu propia GPU.

Qué hace el modo de voz de Claude Code

Se activa con /voice. En el modo predeterminado, hold, mantienes pulsada la barra espaciadora mientras hablas; en el modo tap, la pulsas una vez para empezar y otra para enviar. La transcripción aparece en el prompt mientras hablas, atenuada hasta que es definitiva, y puedes mezclar teclado y voz en el mismo mensaje. La grabación se detiene sola tras quince segundos de silencio o dos minutos en total. La transcripción está ajustada al vocabulario de programación, y Claude Code añade discretamente el nombre de tu proyecto y tu rama de git como pistas para el reconocimiento, un detalle ingenioso. Y no descuenta nada de tus límites de uso.

Ahora viene la parte que la propia documentación de Anthropic pone como primer requisito, textualmente: «El dictado por voz transmite el audio grabado a los servidores de Anthropic para transcribirlo. El audio no se procesa en local» ("Voice dictation streams your recorded audio to Anthropic's servers for transcription. Audio is not processed locally."). De esa frase se siguen tres consecuencias, y la misma página las detalla.

  • Necesita una cuenta de claude.ai. El servicio de voz no está disponible cuando Claude Code funciona con una clave de API, Amazon Bedrock, Agent Platform de Google Cloud o Microsoft Foundry. Las empresas que eligieron esas vías por motivos de residencia de datos se quedan sin modo de voz, lo cual es coherente, aunque incómodo.
  • Necesita un micrófono local. No hay voz en sesiones SSH, en Claude Code en la web, en VS Code Remote, Dev Containers ni Codespaces, ni tampoco en WSL1.
  • Habla veinte idiomas, de uno en uno. El dictado sigue el ajuste language y por defecto está en inglés. Si lo pones en polaco, dictas en polaco; si hablas polaco con el ajuste en inglés, la transcripción sale sin sentido, como reconoce la sección de solución de problemas. No hay detección automática.

Nada de esto es una crítica a la ingeniería. Es la descripción de una arquitectura: un servicio de transcripción en la nube muy bueno, integrado en una sola aplicación y disponible para un solo tipo de cuenta.

Dónde se queda corto en el trabajo diario

Las condiciones de cuenta y de red importan a unos y a otros no. Hay dos límites que afectan a todo el mundo.

Solo funciona dentro del prompt de Claude Code. En cuanto cambias a una sesión de Codex, un chat de Cursor, una issue de GitHub en el navegador, un mensaje de commit en tu editor o un hilo de Slack, la voz desaparece. Quien habla con agentes rara vez habla con uno solo.

El audio sale del equipo. En un proyecto personal, eso no le preocupa a nadie. Con el código de un cliente bajo acuerdo de confidencialidad, con una empresa de un sector regulado o, sin más, para un desarrollador que eligió modelos locales por algo, es una línea que no se cruza. Algunas organizaciones ya han desactivado la función por política, y Claude Code lo indica con el mensaje "Voice mode is disabled by your organization's policy".

La alternativa local, medida

Una tecla de dictado para todo el sistema esquiva los dos límites: la pulsas en cualquier ventana, hablas, la vuelves a pulsar y el texto aparece donde estaba el cursor, transcrito por un modelo Whisper en tu propia tarjeta gráfica. La pregunta obvia es si la transcripción local es lo bastante rápida para que se sienta como una conversación. Medimos nuestro propio motor, el que lleva AlphaDictate, en el portátil en el que se escribió este artículo, que tiene una GPU dedicada NVIDIA RTX 5070 Ti para portátil y una AMD Radeon 890M integrada. El clip son 77 segundos de voz sintetizada en inglés sobre una reunión de producto, cortados en duraciones típicas de una toma; cada cifra es la mediana de tres pasadas por el motor que distribuimos y no incluye la fracción de segundo que tarda el propio pegado.

Duración de la tomaModelo Rápido, dedicadaModelo Mejor, dedicadaModelo Rápido, integradaModelo Mejor, integrada
5 segundos0,13 s0,29 s0,31 s1,2 s
15 segundos0,30 s0,77 s0,64 s2,0 s
60 segundos1,6 s3,0 s2,7 s9,3 s

Cargar un modelo en la GPU se hace una sola vez y tardó entre uno y dos segundos y medio, según el tamaño. Un prompt típico para un agente son de diez a veinte segundos de voz, así que con una GPU dedicada el texto aparece menos de un segundo después de que dejes de hablar, con el modelo más preciso, y con una GPU integrada en unos dos segundos, o en bastante menos de un segundo si eliges el modelo Rápido. Una vez contado el viaje de ida y vuelta, el dictado en la nube no es apreciablemente más rápido, y el local no se ralentiza cuando la conexión es mala.

Las tomas más largas rara vez esperan siquiera eso: AlphaDictate transcribe lo que has dicho en cada pausa mientras sigues hablando, así que tras un minuto de dictado con pausas solo queda el último tramo, alrededor de medio segundo en la GPU dedicada y dos segundos en la integrada con el modelo más preciso. Nuestro artículo sobre la GPU tiene esas cifras.

Dos advertencias honestas. La voz sintetizada es más limpia que una persona murmurando ante el micrófono de un portátil, así que esta prueba no mide la precisión; mide la latencia. Y la GPU integrada de las tablas es la de un portátil de 2025; las gráficas integradas más antiguas serán más lentas, y por eso la aplicación ofrece tres tamaños de modelo y te dice en el primer inicio cuál admite tu hardware.

El problema de la terminal del que nadie habla

Todas las herramientas de dictado de Windows, la nuestra incluida, meten el texto en una terminal de la misma manera: ponen la transcripción en el portapapeles y envían un pegado. Windows Terminal, la terminal de VS Code y la consola en la que se ejecuta Claude Code aceptan Ctrl+V, así que funciona. Hay dos cosas que lo rompen, y lo rompen para todas las herramientas.

La primera es una terminal con privilegios elevados. Si ejecutas tu shell como administrador, Windows descarta en silencio las pulsaciones que inyecta un programa con privilegios normales, y el pegado parece no hacer nada, sin ningún error en ninguna parte. AlphaDictate lo comprueba antes de pegar y te avisa de que el texto está en el portapapeles para que pulses Ctrl+V tú mismo, en lugar de perder la toma. La segunda es el propio portapapeles: el pegado sustituye lo que tuvieras copiado. Decidimos dejar la transcripción en el portapapeles a propósito, para que un pegado que falle por el motivo que sea quede a un Ctrl+V de distancia, y además cada toma se guarda en el historial local de la aplicación. Si dictas en mitad de copiar algo valioso, vuelve a copiarlo después. Es una concesión consciente, y preferimos contarlo aquí antes de que lo descubras tú.

Cómo configurar una tecla de dictado local para trabajar con agentes

  1. Instala una aplicación de dictado local y deja que descargue un modelo. Elige el modelo Rápido si tienes gráfica integrada y quieres resultados en menos de un segundo; elige Mejor si tienes una GPU dedicada.
  2. Asígnale algo que puedas pulsar sin mirar. Un botón lateral del ratón es ideal para trabajar con agentes: la mano en el ratón, pulsas, hablas, pulsas y el prompt se rellena.
  3. Deja el idioma en detección automática si piensas en más de un idioma. Whisper te seguirá a mitad de frase.
  4. Añade una vez a la pista de vocabulario las palabras raras de tu proyecto: los nombres de los servicios internos, la biblioteca que no paras de mencionar, el apellido de tu cofundador.
  5. Si te gusta la vista previa en directo mientras dictas en Claude Code, mantén activado también su modo de voz. No chocan entre sí: uno es una tecla dentro de una aplicación; el otro, una tecla en todas partes.

Nosotros hacemos AlphaDictate, así que lee la recomendación teniéndolo en cuenta, y ten presente que la alternativa gratuita de la misma categoría es Handy, una aplicación de dictado local de código abierto, con menos funciones y sin coste. Nuestra nota anterior sobre la escritura por voz de Windows trata la opción integrada en el sistema, que también envía el audio a un servidor y también se limita a un idioma.


Preguntas frecuentes

¿El modo de voz de Claude Code procesa el audio en local? No. La documentación de Anthropic dice que el audio se transmite a los servidores de Anthropic para transcribirlo y que no se procesa en local.

¿Por qué /voice dice que necesita una cuenta de Claude.ai? El servicio de voz a texto solo se ofrece a quien inicia sesión con claude.ai. Las sesiones de Claude Code autenticadas con una clave de API, Bedrock, Agent Platform de Google Cloud o Microsoft Foundry no pueden usarlo.

¿Puedo dictar a Claude Code por SSH? Con el modo de voz integrado no, porque necesita un micrófono local. Una aplicación de dictado para todo el sistema que se ejecute en tu equipo local escribe en la terminal SSH como en cualquier otra ventana.

¿Qué idiomas admite la voz de Claude Code? Veinte, entre ellos inglés, alemán, francés, español, portugués, polaco, japonés, coreano y ucraniano, que se eligen con el ajuste de idioma en lugar de detectarse.

¿Qué rapidez tiene el dictado local en un portátil? En el portátil que medimos, una toma de quince segundos se transcribió en menos de un segundo en la GPU dedicada con el modelo más preciso, y en unos dos segundos en la integrada, o en menos de un segundo con el modelo Rápido.

¿Funciona el dictado en una terminal de administrador? En Windows, las ventanas con privilegios elevados ignoran los pegados inyectados, sea cual sea la herramienta. AlphaDictate lo detecta y deja el texto en el portapapeles para que pulses Ctrl+V a mano.

Este artículo se tradujo del inglés con una máquina y se revisó para que tenga sentido, no con un revisor nativo. La versión en inglés es la de referencia.