Blog / Jakie GPU do lokalnego dyktowania? Pewnie to, które już masz

Jakie GPU do lokalnego dyktowania? Pewnie to, które już masz

„Działa na Twoim GPU” brzmi tak, jakby trzeba było mieć komputer do gier. Nie trzeba. Zmierzyliśmy nasz silnik dyktowania na dwóch układach graficznych jednego zwyczajnego laptopa z 2025 roku: dedykowanej karcie NVIDIA RTX 5070 Ti w wersji laptopowej i układzie AMD Radeon 890M zintegrowanym z procesorem — takiej grafice, jaką laptop ze średniej półki ma wbudowaną w procesor. Oba zamieniają typowy wypowiedziany akapit na tekst szybciej, niż zdążysz przenieść rękę z klawisza na mysz, a przy długim dyktowaniu aplikacja ukrywa większość pozostałego czekania, bo pracuje, gdy Ty mówisz. Na tej stronie są liczby, pamięć, jakiej potrzebuje każdy model, i jedyny rodzaj komputera, na którym lokalne dyktowanie nie działa.

Jak mierzyliśmy

Dźwięk to 77-sekundowy fragment syntetycznej angielskiej mowy o spotkaniu produktowym, pocięty na długości, jakie ludzie naprawdę dyktują: 5 sekund na odpowiedź na czacie, 15 na akapit albo prompt dla agenta AI, 60 na długi e-mail. Każdy fragment przeszedł przez dokładnie ten silnik, który dostarcza AlphaDictate — Whisper uruchamiany przez whisper.cpp na Vulkanie — po trzy razy na każdy punkt pomiarowy; tabele pokazują medianę. Pomiar obejmuje tylko transkrypcję, od chwili, gdy przestajesz mówić, do chwili, gdy tekst jest gotowy, i pomija ułamek sekundy potrzebny na wklejenie. Każdy przebieg zwrócił pełną transkrypcję, więc szybkie wyniki nie biorą się z pomijania fragmentów nagrania.

Trzy modele to trzy poziomy w aplikacji: Szybki to Whisper Small, Zrównoważony to Whisper Medium, a Najlepszy to Whisper Large v3, wszystkie skompresowane do wag 5-bitowych.

Wypowiedziany akapit: 15 sekund mowy

GrafikaSzybkiZrównoważonyNajlepszy
RTX 5070 Ti Laptop GPU, dedykowana0,30 s0,55 s0,77 s
Radeon 890M, zintegrowana0,64 s1,2 s2,0 s

Na dedykowanej karcie każdy model kończy w niecałą sekundę, więc nie ma powodu wybierać niczego poza modelem Najlepszy. Na grafice zintegrowanej model Najlepszy potrzebuje około dwóch sekund — to zauważalne, ale przy e-mailu nie przeszkadza; model Szybki mieści się poniżej sekundy i nadal dobrze radzi sobie z wyraźną mową.

Długie nagranie i dlaczego rzadko czekasz na całość

Przy minucie mowy przepisywanej w jednym kawałku drogi obu układów się rozchodzą:

60 sekund w całościSzybkiZrównoważonyNajlepszy
RTX 5070 Ti Laptop GPU, dedykowana1,6 s2,3 s3,0 s
Radeon 890M, zintegrowana2,7 s5,4 s9,3 s

Dziewięć sekund po minucie mówienia, dziesięć razy dziennie, byłoby irytujące. Rzadko do tego dochodzi, bo AlphaDictate nie czeka, aż skończysz. Gdy ma już osiem sekund dźwięku, a Ty robisz pauzę — domyślnie pięciosekundową — przekazuje do GPU to, co zostało dotąd powiedziane, i słucha dalej. Gdy naciśniesz stop, do zrobienia zostaje tylko część od ostatniej pauzy. Nieprzerwana mowa nigdy nie jest dzielona, więc żadne słowo nie zostaje przecięte na pół.

Żeby to zmierzyć, zbudowaliśmy nagranie tak, jak ludzie naprawdę dyktują: około minuty mowy w czterech odcinkach po 13–18 sekund, z pięciosekundową pauzą na zastanowienie między nimi, łącznie 74 sekundy. Odtworzyliśmy je przez logikę dzielenia samej aplikacji, w rzeczywistym tempie, i zmierzyliśmy czekanie po naciśnięciu stop:

Minuta dyktowania z pauzamiSzybki, w całościSzybki, z podziałem przy pauzachNajlepszy, w całościNajlepszy, z podziałem przy pauzach
RTX 5070 Ti Laptop GPU, dedykowana1,4 s0,24 s2,8 s0,53 s
Radeon 890M, zintegrowana3,1 s0,57 s11,0 s2,1 s

Dzielenie skraca czekanie mniej więcej pięciokrotnie na obu układach. Z najdokładniejszym modelem grafika zintegrowana oddaje minutę dyktowania po około dwóch sekundach, tyle samo co pojedynczy akapit, bo zanim skończysz, do przepisania zostaje tylko Twój ostatni akapit.

To samo pokazuje nasze własne korzystanie z aplikacji na tym laptopie. W ostatnim tygodniu dyktowania mniej więcej połowa nagrań dłuższych niż 20 sekund miała pauzę na tyle długą, by je podzielić. W tych nagraniach po naciśnięciu stop do przepisania zostawało w medianie 13 sekund mowy, a mediana czekania wynosiła 0,8 sekundy. Długie nagrania bez takiej pauzy czekały w medianie 1,7 sekundy. Długość pauzy to ustawienie — „Pauza kończąca część” w sekcji „Dokładność i szybkość” — i można ją skrócić nawet do dwóch sekund, jeśli chcesz szybciej dostawać wyniki i mówisz bez wahania.

Plik z nagraniem: 10 minut

GrafikaSzybkiNajlepszy
RTX 5070 Ti Laptop GPU, dedykowana16 s28 s
Radeon 890M, zintegrowana36 s1 min 54 s

Przy plikach nie da się niczego zrobić zawczasu, bo całe nagranie jest gotowe, zanim zacznie się transkrypcja, i właśnie tu dedykowane GPU pokazuje, na co je stać. Godzinne nagranie spotkania na dedykowanej karcie z modelem Najlepszy zajmuje około trzech minut; na grafice zintegrowanej — około jedenastu. Obie opcje wygrywają z wysyłaniem godziny poufnego spotkania do usługi w chmurze i czekaniem, aż wróci.

Ile pamięci potrzebuje każdy model

ModelUżyta pamięć GPU
Szybkiokoło 0,6 GB
Zrównoważonyokoło 1,2 GB
Najlepszyokoło 2,1 GB

Odczytaliśmy te wartości z wbudowanych w Windows liczników użycia GPU przez poszczególne procesy, gdy każdy z modeli był wczytany; na obu układach były takie same. Wynikają z tego dwie praktyczne rzeczy. Każda dedykowana karta z 4 GB pamięci zmieści nawet największy model z zapasem, więc wiek karty ma większe znaczenie niż ilość jej pamięci. A grafika zintegrowana nie ma własnej pamięci: pożycza systemowy RAM, więc w laptopie z 8 GB model Najlepszy zajmuje jego ćwierć. Na takim komputerze rozważniejszym wyborem jest Zrównoważony; przy 16 GB lub więcej nie ma to znaczenia.

Dlaczego nie ma wersji na sam procesor

Jedyny komputer, któremu lokalne dyktowanie nie posłuży dobrze, to komputer bez żadnego używalnego GPU: sesja pulpitu zdalnego, maszyna wirtualna, serwer. Zbudowaliśmy wersję działającą wyłącznie na procesorze i zmierzyliśmy, że jest od pięciu do dwudziestu razy wolniejsza niż grafika zintegrowana, co zamienia dwusekundowe czekanie w pół minuty. Usunęliśmy ją tego samego dnia. Narzędzie do dyktowania, które po cichu każe czekać trzydzieści sekund, jest gorsze od takiego, które wprost mówi, że potrzebuje układu graficznego, dlatego AlphaDictate przy pierwszym uruchomieniu sprawdza, czy jest GPU ze sterownikiem Vulkan, i mówi o tym, jeśli go nie znajdzie.

W praktyce ma je niemal każdy komputer z Windows sprzedany w ostatnich kilku latach, zintegrowane lub dedykowane. Najczęściej na przeszkodzie stoi stary sterownik graficzny, a jego aktualizacja ze strony producenta rozwiązuje problem.

Co wybrać

  • Komputer lub laptop do gier z dowolną dedykowaną kartą NVIDIA lub AMD: Najlepszy. Wszystko trwa poniżej sekundy, a transkrypcje są najdokładniejsze.
  • Nowy laptop z grafiką zintegrowaną i 16 GB RAM: Najlepszy. Krótkie fragmenty zajmują około dwóch sekund, a długie niewiele więcej, dzięki dzieleniu przy pauzach. Zrównoważony, jeśli przepisujesz wiele długich nagrań z plików.
  • Laptop z 8 GB RAM: Zrównoważony albo Szybki, jeśli komputer jest starszy.
  • Starsza lub energooszczędna grafika zintegrowana: zacznij od modelu Szybki. Starszych układów jeszcze nie mierzyliśmy, więc traktuj powyższe wyniki grafiki zintegrowanej jako górną granicę jej możliwości.
  • Laptop z oboma układami: nie musisz wybierać. AlphaDictate korzysta z dedykowanego GPU, gdy jest dostępne, a ze zintegrowanego, gdy dedykowany układ jest wyłączony dla oszczędzania energii, i przełącza się między nimi w przerwie między nagraniami.

Ekran konfiguracji AlphaDictate podaje nazwę znalezionej grafiki i proponuje model na start: Najlepszy na komputerach z grafiką NVIDIA, Zrównoważony na pozostałych. Model zmienisz później jednym kliknięciem, a wszystkie trzy są w cenie: $39/rok po darmowej godzinie. Co ma Twój komputer, sprawdzisz w Menedżerze zadań na karcie Wydajność, gdzie każde GPU jest wymienione razem ze swoją pamięcią.

Jeśli masz GPU, którego nie mierzyliśmy, zwłaszcza starszy zintegrowany układ Intel lub AMD, chętnie poznamy Twoje wyniki: hello@alphadictate.com. Nasz tekst o dyktowaniu do Claude Code przedstawia te same pomiary z perspektywy programisty.


Najczęstsze pytania

Czy do lokalnego rozpoznawania mowy potrzebuję karty graficznej dla graczy? Nie. Na grafice zintegrowanej laptopa z 2025 roku 15-sekundowy wypowiedziany akapit jest przepisywany w około dwie sekundy przez Whisper Large v3 i w niecałą sekundę przez najmniejszy model.

Czy przy długim dyktowaniu muszę czekać na przepisanie wszystkiego od początku? Nie. AlphaDictate przepisuje dotychczasową wypowiedź przy każdej pauzie, a Ty mówisz dalej, więc po minucie dyktowania z pauzami czekanie wynosiło około dwóch sekund na grafice zintegrowanej i pół sekundy na dedykowanym GPU z najdokładniejszym modelem.

Ile VRAM potrzebuje Whisper Large v3? Około 2,1 GB w skompresowanej postaci, której używa AlphaDictate. Whisper Medium potrzebuje około 1,2 GB, a Whisper Small około 0,6 GB.

Czy Whisper działa na grafice zintegrowanej? Tak, przez sterownik Vulkan. Grafika zintegrowana korzysta z pamięci systemowej, więc pamięć dla modelu jest brana z Twojego RAM-u.

Czy AlphaDictate działa bez GPU? Nie. Wymaga układu graficznego ze sterownikiem Vulkan, zintegrowanego lub dedykowanego. Wersja działająca tylko na procesorze była od pięciu do dwudziestu razy wolniejsza niż grafika zintegrowana, więc jej nie udostępniamy.

Ile trwa lokalna transkrypcja godziny nagrania? W naszym pomiarze około trzech minut na laptopowym RTX 5070 Ti i około jedenastu minut na zintegrowanej grafice Radeon 890M z najdokładniejszym modelem.

Ten artykuł przetłumaczyła z angielskiego maszyna; sprawdziliśmy, czy ma sens, ale nie recenzował go native speaker. Wersją odniesienia jest angielska.