Blog / ¿Qué GPU necesitas para dictar en local? Seguramente la que ya tienes

¿Qué GPU necesitas para dictar en local? Seguramente la que ya tienes

«Funciona en tu GPU» suena a que hace falta un PC para juegos. No es así. Cronometramos nuestro propio motor de dictado en los dos chips gráficos de un portátil corriente de 2025: una GPU dedicada NVIDIA RTX 5070 Ti para portátil y la AMD Radeon 890M integrada en su procesador, el tipo de gráfica que viene dentro de la CPU de un portátil de gama media. Las dos convierten en texto un párrafo hablado típico antes de que te dé tiempo a llevar la mano de la tecla al ratón, y en los dictados largos la aplicación oculta casi toda la espera restante trabajando mientras hablas. Esta página tiene las cifras, la memoria que necesita cada modelo y el único tipo de máquina en el que el dictado local no funciona.

Cómo lo medimos

El audio es un clip de 77 segundos de voz sintetizada en inglés sobre una reunión de producto, cortado en las duraciones que la gente dicta de verdad: 5 segundos para una respuesta de chat, 15 para un párrafo o un prompt a un agente de IA, 60 para un correo largo. Cada clip pasó tres veces, en cada configuración, por exactamente el mismo motor que distribuye AlphaDictate (Whisper sobre whisper.cpp con Vulkan); las tablas muestran la mediana. El cronómetro cubre solo la transcripción, desde que dejas de hablar hasta que el texto existe, y deja fuera la fracción de segundo que tarda el pegado. Todas las pasadas devolvieron la transcripción completa, así que las cifras rápidas no se deben a que el motor se salte audio.

Los tres modelos son los tres niveles de la aplicación: Rápido es Whisper Small, Equilibrado es Whisper Medium y Mejor es Whisper Large v3, todos comprimidos a pesos de 5 bits.

Un párrafo hablado: 15 segundos de voz

GráficaRápidoEquilibradoMejor
GPU RTX 5070 Ti de portátil, dedicada0,30 s0,55 s0,77 s
Radeon 890M, integrada0,64 s1,2 s2,0 s

En la tarjeta dedicada todos los modelos terminan en menos de un segundo, así que no hay motivo para elegir otro que no sea Mejor. En la gráfica integrada, el modelo Mejor tarda unos dos segundos, algo que notas pero que no molesta en un correo; el modelo Rápido baja del segundo y sigue llevando bien el habla clara.

Una toma larga, y por qué casi nunca la esperas entera

Transcrito de una sola vez, un minuto de voz es donde los dos chips se separan:

60 segundos, todo de una vezRápidoEquilibradoMejor
GPU RTX 5070 Ti de portátil, dedicada1,6 s2,3 s3,0 s
Radeon 890M, integrada2,7 s5,4 s9,3 s

Nueve segundos después de un minuto hablando resultarían irritantes diez veces al día. Casi nunca se llega a eso, porque AlphaDictate no espera a que termines. En cuanto tiene ocho segundos de audio y haces una pausa, de cinco segundos por defecto, pasa a la GPU lo que llevas dicho y sigue escuchando. Cuando pulsas para parar, solo queda por hacer la parte desde tu última pausa. El habla sin interrupciones nunca se divide, así que ninguna palabra se corta por la mitad.

Para medirlo, montamos una toma como las que la gente dicta de verdad: alrededor de un minuto de voz en cuatro tramos de 13 a 18 segundos, con una pausa de cinco segundos para pensar entre uno y otro, 74 segundos en total. La reprodujimos con la propia lógica de división de la aplicación, a su ritmo real, y cronometramos la espera tras parar:

Un minuto de dictado con pausasRápido, todo de una vezRápido, dividido en las pausasMejor, todo de una vezMejor, dividido en las pausas
GPU RTX 5070 Ti de portátil, dedicada1,4 s0,24 s2,8 s0,53 s
Radeon 890M, integrada3,1 s0,57 s11,0 s2,1 s

Dividir reduce la espera unas cinco veces en los dos chips. Con el modelo más preciso, la gráfica integrada responde a un minuto de dictado en unos dos segundos, lo mismo que a un solo párrafo, porque cuando paras solo queda tu último párrafo.

Nuestro propio uso de la aplicación en este portátil apunta a lo mismo. En la última semana dictando con ella, alrededor de la mitad de las tomas de más de 20 segundos incluyeron una pausa lo bastante larga para dividirlas. En esas, tras parar quedaba por transcribir una mediana de 13 segundos de voz, y la espera mediana fue de 0,8 segundos. Las tomas largas dictadas sin una pausa así esperaron una mediana de 1,7 segundos. La duración de la pausa es un ajuste, Pausa que cierra una parte, en Precisión y velocidad, y puede bajar hasta dos segundos si quieres resultados antes y hablas sin titubear.

Una grabación: un archivo de 10 minutos

GráficaRápidoMejor
GPU RTX 5070 Ti de portátil, dedicada16 s28 s
Radeon 890M, integrada36 s1 min 54 s

Los archivos no tienen ventaja de salida, porque la grabación entera ya está ahí antes de que empiece la transcripción, así que aquí es donde una GPU dedicada se gana el sueldo. La grabación de una reunión de una hora tarda unos tres minutos en la tarjeta dedicada con el modelo Mejor; en la gráfica integrada, unos once. Las dos opciones ganan a enviar una hora de una reunión confidencial a un servicio en la nube y esperar a que vuelva.

Cuánta memoria necesita cada modelo

ModeloMemoria de GPU usada
Rápidounos 0,6 GB
Equilibradounos 1,2 GB
Mejorunos 2,1 GB

Leímos estas cifras en los contadores de GPU por proceso del propio Windows con cada modelo cargado, y fueron las mismas en los dos chips. Dos consecuencias prácticas. Cualquier tarjeta dedicada con 4 GB de memoria aguanta incluso el modelo más grande con margen de sobra, así que importa más la antigüedad de la tarjeta que su memoria. Y la gráfica integrada no tiene memoria propia: toma prestada la RAM del sistema, así que en un portátil con 8 GB el modelo Mejor se queda con una cuarta parte. En una máquina así, Equilibrado es la opción más respetuosa con el resto del sistema; con 16 GB o más da igual.

Por qué no hay versión para CPU

La única máquina a la que el dictado local no sirve bien es una sin ninguna GPU utilizable: una sesión de escritorio remoto, una máquina virtual, un servidor. Hicimos una versión que funcionaba solo con el procesador y medimos que era entre cinco y veinte veces más lenta que la gráfica integrada, lo que convierte una espera de dos segundos en medio minuto. La quitamos el mismo día. Una herramienta de dictado que tarda treinta segundos sin avisar es peor que una que te dice claramente que necesita un chip gráfico, así que AlphaDictate comprueba en el primer inicio si hay una GPU con controlador Vulkan y te lo dice si no la encuentra.

En la práctica, casi todos los PC con Windows vendidos en los últimos años tienen una, integrada o dedicada. Lo que suele fallar es un controlador gráfico antiguo, y actualizarlo desde la web del fabricante lo arregla.

Qué elegir

  • PC o portátil para juegos con cualquier tarjeta dedicada de NVIDIA o AMD: Mejor. Todo baja del segundo y obtienes las transcripciones más precisas.
  • Portátil reciente con gráfica integrada y 16 GB de RAM: Mejor. Los fragmentos cortos tardan unos dos segundos y los largos apenas más, gracias a la división en las pausas. Equilibrado si transcribes muchas grabaciones largas.
  • Portátil con 8 GB de RAM: Equilibrado, o Rápido si la máquina es antigua.
  • Gráfica integrada antigua o de bajo consumo: empieza con Rápido. Todavía no hemos medido chips más antiguos, así que toma las cifras de gráfica integrada de arriba como lo mejor que cabe esperar de una integrada.
  • Un portátil con los dos chips: no tienes que elegir. AlphaDictate usa la GPU dedicada cuando está disponible y la integrada cuando el chip dedicado se apaga para ahorrar energía, y cambia de una a otra en la pausa entre tomas.

La pantalla de configuración inicial de AlphaDictate muestra la gráfica que ha encontrado y sugiere un modelo para empezar: Mejor en equipos con gráfica NVIDIA y Equilibrado en los demás. Cambiar de modelo después es cuestión de un clic, y los tres están incluidos en el precio, 39 $/año después de una hora gratis. Puedes ver qué tiene tu PC en el Administrador de tareas, en Rendimiento, donde aparece cada GPU con su memoria.

Si tienes una GPU que no hemos medido, sobre todo un chip integrado antiguo de Intel o AMD, nos gustaría recibir tus cifras en hello@alphadictate.com. Nuestra nota sobre dictar a Claude Code usa las mismas mediciones desde el punto de vista de un desarrollador.


Preguntas frecuentes

¿Necesito una GPU para juegos para el reconocimiento de voz local? No. En la gráfica integrada de un portátil de 2025, un párrafo hablado de 15 segundos se transcribe en unos dos segundos con Whisper Large v3 y en menos de un segundo con el modelo más pequeño.

¿Tengo que esperar a que un dictado largo se transcriba desde el principio? No. AlphaDictate transcribe lo que has dicho en cada pausa mientras sigues hablando, así que tras un minuto de dictado con pausas la espera fue de unos dos segundos en la gráfica integrada y de medio segundo en una GPU dedicada, con el modelo más preciso.

¿Cuánta VRAM necesita Whisper Large v3? Unos 2,1 GB en la forma comprimida que usa AlphaDictate. Whisper Medium necesita unos 1,2 GB y Whisper Small, unos 0,6 GB.

¿Whisper puede funcionar en una gráfica integrada? Sí, a través de un controlador Vulkan. La gráfica integrada usa la memoria del sistema, así que la memoria del modelo sale de tu RAM.

¿AlphaDictate funciona sin GPU? No. Necesita un chip gráfico con controlador Vulkan, integrado o dedicado. Una versión solo para procesador era entre cinco y veinte veces más lenta que la gráfica integrada, así que no la distribuimos.

¿Cuánto se tarda en transcribir una hora de audio en local? En nuestra medición, unos tres minutos con una RTX 5070 Ti de portátil y unos once minutos con la gráfica integrada Radeon 890M, con el modelo más preciso.

Este artículo se tradujo del inglés con una máquina y se revisó para que tenga sentido, no con un revisor nativo. La versión en inglés es la de referencia.