Blog / Quel GPU pour la dictée locale ? Sans doute celui que vous avez déjà

Quel GPU pour la dictée locale ? Sans doute celui que vous avez déjà

« Tourne sur votre GPU » : on croirait qu'il faut un PC de joueur. Ce n'est pas le cas. Nous avons chronométré notre propre moteur de dictée sur les deux puces graphiques d'un portable ordinaire de 2025 : un GPU dédié NVIDIA RTX 5070 Ti pour portable et l'AMD Radeon 890M intégrée à son processeur, le genre de puce graphique que l'on trouve dans le processeur d'un portable de milieu de gamme. Toutes deux transforment un paragraphe parlé typique en texte plus vite que vous ne déplacez la main de la touche à la souris, et pour les longues dictées, l'application masque l'essentiel de l'attente restante en travaillant pendant que vous parlez. Cette page donne les chiffres, la mémoire nécessaire à chaque modèle, et le seul type de machine sur lequel la dictée locale ne fonctionne pas.

Notre méthode de mesure

L'audio est un extrait de 77 secondes de parole anglaise synthétique à propos d'une réunion produit, découpé aux durées que les gens dictent réellement : 5 secondes pour une réponse dans un chat, 15 pour un paragraphe ou un prompt adressé à un agent d'IA, 60 pour un long e-mail. Chaque extrait est passé trois fois par point de mesure dans le moteur exact que livre AlphaDictate, Whisper exécuté par whisper.cpp sur Vulkan ; les tableaux donnent la médiane. Le chronomètre couvre uniquement la transcription, du moment où vous arrêtez de parler au moment où le texte existe, et exclut la fraction de seconde que prend le collage. Chaque passage a restitué la transcription complète : les chiffres rapides ne viennent donc pas d'un moteur qui saute de l'audio.

Les trois modèles correspondent aux trois niveaux de l'application : Rapide est Whisper Small, Équilibré est Whisper Medium et Meilleur est Whisper Large v3, tous compressés avec des poids sur 5 bits.

Un paragraphe parlé : 15 secondes de parole

Carte graphiqueRapideÉquilibréMeilleur
GPU RTX 5070 Ti pour portable, dédié0,30 s0,55 s0,77 s
Radeon 890M, intégré0,64 s1,2 s2,0 s

Sur la carte dédiée, chaque modèle termine en moins d'une seconde : il n'y a donc aucune raison de choisir autre chose que Meilleur. Sur la puce graphique intégrée, le modèle Meilleur prend environ deux secondes, ce qui se remarque sans gêner pour un e-mail ; le modèle Rapide passe sous la seconde et gère encore bien une parole claire.

Une longue prise, et pourquoi vous n'en attendez presque jamais la totalité

Transcrite d'un seul bloc, une minute de parole est le point où les deux puces se séparent :

60 secondes, en un seul blocRapideÉquilibréMeilleur
GPU RTX 5070 Ti pour portable, dédié1,6 s2,3 s3,0 s
Radeon 890M, intégré2,7 s5,4 s9,3 s

Neuf secondes après une minute de parole, ce serait agaçant dix fois par jour. On en arrive rarement là, car AlphaDictate n'attend pas que vous ayez fini. Dès qu'il dispose de huit secondes d'audio et que vous faites une pause, de cinq secondes par défaut, il confie au GPU ce que vous avez dit jusque-là et continue d'écouter. Quand vous appuyez pour arrêter, il ne reste que la partie qui suit votre dernière pause. Une parole ininterrompue n'est jamais découpée : aucun mot n'est coupé en deux.

Pour le mesurer, nous avons construit une prise à la manière dont les gens dictent vraiment : environ une minute de parole en quatre passages de 13 à 18 secondes, séparés par une pause de réflexion de cinq secondes, 74 secondes en tout. Nous l'avons rejouée dans la logique de découpage de l'application elle-même, à son rythme réel, et avons chronométré l'attente après l'arrêt :

Une minute de dictée avec des pausesRapide, en un seul blocRapide, découpé aux pausesMeilleur, en un seul blocMeilleur, découpé aux pauses
GPU RTX 5070 Ti pour portable, dédié1,4 s0,24 s2,8 s0,53 s
Radeon 890M, intégré3,1 s0,57 s11,0 s2,1 s

Le découpage divise l'attente par cinq environ sur les deux puces. Avec le modèle le plus précis, la puce graphique intégrée répond à une minute de dictée en deux secondes environ, autant que pour un seul paragraphe, car au moment où vous arrêtez, il ne reste que votre dernier paragraphe.

Notre propre usage de l'application sur ce portable raconte la même histoire. Au cours de la dernière semaine de dictée, environ la moitié des prises de plus de 20 secondes contenaient une pause assez longue pour y découper. Pour celles-là, il restait en médiane 13 secondes de parole à transcrire après l'arrêt, et l'attente médiane était de 0,8 seconde. Les longues prises dictées sans une telle pause ont attendu 1,7 seconde en médiane. La durée de la pause est un réglage, « Pause qui termine une partie » dans le volet Précision et vitesse, et peut descendre jusqu'à deux secondes si vous voulez des résultats plus tôt et parlez sans hésiter.

Un enregistrement : un fichier de 10 minutes

Carte graphiqueRapideMeilleur
GPU RTX 5070 Ti pour portable, dédié16 s28 s
Radeon 890M, intégré36 s1 min 54 s

Les fichiers ne bénéficient d'aucune avance, puisque l'enregistrement entier est déjà là avant que la transcription commence : c'est donc là qu'un GPU dédié se rend vraiment utile. L'enregistrement d'une réunion d'une heure prend environ trois minutes sur la carte dédiée avec le modèle Meilleur, et environ onze sur la puce intégrée. Dans les deux cas, c'est mieux que d'envoyer une heure de réunion confidentielle à un service cloud et d'attendre qu'elle revienne.

La mémoire nécessaire à chaque modèle

ModèleMémoire GPU utilisée
Rapideenviron 0,6 Go
Équilibréenviron 1,2 Go
Meilleurenviron 2,1 Go

Nous avons relevé ces valeurs avec les compteurs GPU par processus de Windows lui-même pendant que chaque modèle était chargé, et elles étaient identiques sur les deux puces. Deux conséquences pratiques. Toute carte dédiée dotée de 4 Go de mémoire accueille même le plus gros modèle avec de la marge : l'âge de la carte compte donc plus que sa quantité de mémoire. Et une puce graphique intégrée n'a pas de mémoire propre : elle emprunte la RAM du système, si bien que sur un portable de 8 Go, le modèle Meilleur en occupe un quart. Sur une telle machine, Équilibré est le choix raisonnable ; avec 16 Go ou plus, cela n'a pas d'importance.

Pourquoi il n'y a pas de version pour processeur seul

La seule machine que la dictée locale ne sert pas bien est une machine sans aucun GPU utilisable : une session de bureau à distance, une machine virtuelle, un serveur. Nous avons construit une version qui tournait uniquement sur le processeur et l'avons mesurée de cinq à vingt fois plus lente qu'une puce graphique intégrée, ce qui transforme une attente de deux secondes en une demi-minute. Nous l'avons retirée le jour même. Un outil de dictée qui prend discrètement trente secondes est pire qu'un outil qui vous dit franchement qu'il a besoin d'une puce graphique : AlphaDictate vérifie donc au premier lancement la présence d'un GPU doté d'un pilote Vulkan, et vous prévient s'il n'en trouve pas.

En pratique, presque tous les PC Windows vendus ces dernières années en ont un, intégré ou dédié. Ce qui bloque le plus souvent, c'est un pilote graphique ancien, et le mettre à jour depuis le site du fabricant règle le problème.

Que choisir

  • PC ou portable de jeu avec n'importe quelle carte dédiée NVIDIA ou AMD : Meilleur. Tout passe sous la seconde, et vous obtenez les transcriptions les plus précises.
  • Portable récent à puce graphique intégrée, 16 Go de RAM : Meilleur. Les passages courts prennent environ deux secondes et les longs à peine plus, grâce au découpage aux pauses. Équilibré si vous transcrivez beaucoup de longs enregistrements.
  • Portable avec 8 Go de RAM : Équilibré, ou Rapide si la machine est plus ancienne.
  • Puce graphique intégrée ancienne ou basse consommation : commencez par Rapide. Nous n'avons pas encore mesuré de puces plus anciennes : considérez les chiffres du GPU intégré ci-dessus comme le haut de la fourchette de ce que font les puces graphiques intégrées.
  • Un portable avec les deux puces : vous n'avez pas à choisir. AlphaDictate utilise le GPU dédié quand il est disponible et le GPU intégré quand la puce dédiée est éteinte pour économiser l'énergie, et il passe de l'un à l'autre dans la pause entre deux prises.

L'écran de configuration d'AlphaDictate indique la carte graphique qu'il a trouvée et suggère un modèle de départ : Meilleur sur les machines équipées d'une carte NVIDIA, Équilibré ailleurs. Changer de modèle plus tard se fait en un clic, et les trois sont compris dans le prix, 39 $ par an après une heure gratuite. Pour voir ce que contient votre propre PC, ouvrez le Gestionnaire des tâches, onglet Performances, où chaque GPU est listé avec sa mémoire.

Si vous avez un GPU que nous n'avons pas mesuré, en particulier une ancienne puce intégrée Intel ou AMD, nous aimerions recevoir vos chiffres à hello@alphadictate.com. Notre article sur la dictée dans Claude Code reprend les mêmes mesures du point de vue d'un développeur.


Questions fréquentes

Faut-il un GPU de jeu pour la reconnaissance vocale locale ? Non. Sur la puce graphique intégrée d'un portable de 2025, un paragraphe parlé de 15 secondes est transcrit en deux secondes environ avec Whisper Large v3, et en moins d'une seconde avec le plus petit modèle.

Faut-il attendre qu'une longue dictée soit transcrite depuis le début ? Non. AlphaDictate transcrit ce que vous avez dit à chaque pause pendant que vous continuez à parler : après une minute de dictée ponctuée de pauses, l'attente était d'environ deux secondes sur la puce graphique intégrée et d'une demi-seconde sur un GPU dédié, avec le modèle le plus précis.

De combien de VRAM Whisper Large v3 a-t-il besoin ? Environ 2,1 Go sous la forme compressée qu'utilise AlphaDictate. Whisper Medium a besoin d'environ 1,2 Go et Whisper Small d'environ 0,6 Go.

Whisper peut-il tourner sur une puce graphique intégrée ? Oui, grâce à un pilote Vulkan. Une puce graphique intégrée utilise la mémoire du système : la mémoire du modèle est donc prise sur votre RAM.

AlphaDictate fonctionne-t-il sans GPU ? Non. Il lui faut une puce graphique avec un pilote Vulkan, intégrée ou dédiée. Une version fonctionnant uniquement sur le processeur était de cinq à vingt fois plus lente qu'une puce graphique intégrée : nous n'en proposons donc pas.

Combien de temps faut-il pour transcrire une heure d'audio en local ? D'après notre mesure, environ trois minutes sur une RTX 5070 Ti pour portable et environ onze minutes sur la puce graphique intégrée Radeon 890M, avec le modèle le plus précis.

Cet article a été traduit de l'anglais par une machine, puis relu pour le sens, mais pas par un relecteur natif. La version anglaise fait foi.