Який GPU потрібен для локального диктування? Імовірно, той, що вже є
«Працює на вашому GPU» звучить так, ніби потрібен ігровий ПК. Це не так. Ми заміряли власний рушій диктування на двох графічних чипах одного звичайного ноутбука 2025 року: дискретній відеокарті NVIDIA RTX 5070 Ti для ноутбуків і вбудованій у його процесор графіці AMD Radeon 890M — саме така графіка стоїть у процесорі ноутбука середнього класу. Обидва чипи перетворюють типовий сказаний абзац на текст швидше, ніж ви встигнете перенести руку з клавіші на мишу, а під час довгого диктування застосунок ховає більшу частину очікування, що лишилося, бо працює, поки ви говорите. На цій сторінці — цифри, пам’ять, потрібна кожній моделі, і єдиний тип машин, на яких локальне диктування не працює.
Як ми міряли
Аудіо — 77-секундний кліп синтезованого англійського мовлення про продуктову нараду, нарізаний на відрізки такої тривалості, яку люди справді диктують: 5 секунд для відповіді в чаті, 15 — для абзацу чи промпту для ШІ-агента, 60 — для довгого листа. Кожен кліп пройшов через той самий рушій, що постачається з AlphaDictate, — Whisper через whisper.cpp на Vulkan — по три рази на кожну точку; у таблицях наведено медіану. Таймер охоплює лише розшифровку, від моменту, коли ви замовкли, до моменту, коли текст готовий, і не враховує частку секунди, яку займає вставка. Кожен прогін повернув повну розшифровку, тож швидкі цифри — не наслідок того, що рушій пропускав аудіо.
Три моделі — це три рівні застосунку: «Швидка» — це Whisper Small, «Баланс» — Whisper Medium, а «Найкраща» — Whisper Large v3, усі стиснуті до 5-бітних ваг.
Сказаний абзац: 15 секунд мовлення
| Графіка | «Швидка» | «Баланс» | «Найкраща» |
|---|---|---|---|
| RTX 5070 Ti для ноутбуків, дискретна | 0,30 с | 0,55 с | 0,77 с |
| Radeon 890M, вбудована | 0,64 с | 1,2 с | 2,0 с |
На дискретній відеокарті кожна модель укладається в секунду, тож немає причин вибирати щось, крім «Найкращої». На вбудованій графіці «Найкраща» працює близько двох секунд — це помітно, але для листа не заважає; «Швидка» вкладається в секунду й досі добре дає раду чіткому мовленню.
Довгий запис — і чому ви рідко чекаєте на нього цілком
Якщо розшифровувати одним шматком, саме на хвилині мовлення шляхи двох чипів розходяться:
| 60 секунд, усе одразу | «Швидка» | «Баланс» | «Найкраща» |
|---|---|---|---|
| RTX 5070 Ti для ноутбуків, дискретна | 1,6 с | 2,3 с | 3,0 с |
| Radeon 890M, вбудована | 2,7 с | 5,4 с | 9,3 с |
Дев’ять секунд після хвилини говоріння дратували б, якби траплялися десять разів на день. До цього рідко доходить, бо AlphaDictate не чекає, поки ви закінчите. Щойно записано вісім секунд аудіо і ви робите паузу (типово п’ять секунд), він передає сказане на GPU і слухає далі. Коли ви зупиняєте запис, лишається обробити тільки те, що прозвучало після останньої паузи. Безперервне мовлення ніколи не розрізається, тож жодне слово не розітнеться навпіл.
Щоб це виміряти, ми склали запис так, як люди справді диктують: приблизно хвилина мовлення чотирма відрізками по 13–18 секунд із п’ятисекундною паузою на роздуми між ними, 74 секунди загалом. Ми прогнали його через власну логіку поділу застосунку в реальному темпі й заміряли очікування після зупинки:
| Хвилина диктування з паузами | «Швидка», усе одразу | «Швидка», частинами на паузах | «Найкраща», усе одразу | «Найкраща», частинами на паузах |
|---|---|---|---|---|
| RTX 5070 Ti для ноутбуків, дискретна | 1,4 с | 0,24 с | 2,8 с | 0,53 с |
| Radeon 890M, вбудована | 3,1 с | 0,57 с | 11,0 с | 2,1 с |
Поділ скорочує очікування приблизно вп’ятеро на обох чипах. З найточнішою моделлю вбудована графіка видає результат хвилинного диктування приблизно за дві секунди — стільки ж, скільки для одного абзацу, бо на момент зупинки лишається тільки ваш останній абзац.
Наше власне користування застосунком на цьому ноутбуці показує те саме. За останній тиждень диктування приблизно половина записів, довших за 20 секунд, мала паузу, достатньо довгу для поділу. Для них після зупинки лишалося розшифрувати в медіані 13 секунд мовлення, а медіанне очікування становило 0,8 секунди. Довгі записи без такої паузи чекали в медіані 1,7 секунди. Тривалість паузи задає параметр «Пауза, що завершує частину» в розділі «Точність і швидкість», і її можна зменшити аж до двох секунд, якщо хочете отримувати результат раніше і говорите без вагань.
Запис: 10-хвилинний файл
| Графіка | «Швидка» | «Найкраща» |
|---|---|---|
| RTX 5070 Ti для ноутбуків, дискретна | 16 с | 28 с |
| Radeon 890M, вбудована | 36 с | 1 хв 54 с |
Файли не мають фори: увесь запис уже є ще до початку розшифровки, тож саме тут дискретний GPU відпрацьовує свої гроші. Годинний запис наради на дискретній відеокарті з найточнішою моделлю обробляється приблизно за три хвилини; на вбудованій графіці — приблизно за одинадцять. Обидва варіанти кращі, ніж надсилати годину конфіденційної наради в хмарний сервіс і чекати, поки вона повернеться.
Скільки пам’яті потрібно кожній моделі
| Модель | Використана пам’ять GPU |
|---|---|
| «Швидка» | близько 0,6 ГБ |
| «Баланс» | близько 1,2 ГБ |
| «Найкраща» | близько 2,1 ГБ |
Ми зчитали ці значення з вбудованих у Windows лічильників GPU для кожного процесу, поки модель була завантажена, і на обох чипах вони збіглися. Звідси два практичні висновки. Будь-яка дискретна відеокарта з 4 ГБ пам’яті вміщує навіть найбільшу модель із запасом, тож вік карти важить більше, ніж обсяг її пам’яті. А вбудована графіка не має власної пам’яті: вона позичає оперативну пам’ять системи, тож на ноутбуці з 8 ГБ модель «Найкраща» забирає чверть. На такій машині «Баланс» — дбайливіший вибір; з 16 ГБ і більше це вже не має значення.
Чому немає версії для процесора
Єдина машина, якій локальне диктування погано підходить, — це машина взагалі без придатного GPU: сеанс віддаленого робочого стола, віртуальна машина, сервер. Ми зробили версію, яка працювала лише на процесорі, і заміряли, що вона в п’ять–двадцять разів повільніша за вбудовану графіку, — двосекундне очікування перетворюється на пів хвилини. Того ж дня ми її прибрали. Інструмент для диктування, який мовчки думає тридцять секунд, гірший за той, що прямо каже, що йому потрібен графічний чип, тож AlphaDictate під час першого запуску шукає GPU з драйвером Vulkan і повідомляє, якщо не знаходить.
Насправді майже кожен ПК з Windows, проданий за останні кілька років, має такий чип — вбудований чи дискретний. Зазвичай на заваді стоїть старий графічний драйвер, і оновлення із сайту виробника це виправляє.
Що вибрати
- Ігровий ПК або ноутбук із будь-якою дискретною відеокартою NVIDIA чи AMD: «Найкраща». Усе вкладається в секунду, і ви отримуєте найточніші розшифровки.
- Сучасний ноутбук із вбудованою графікою і 16 ГБ оперативної пам’яті: «Найкраща». Короткі фрагменти займають близько двох секунд, а довгі — ледь більше завдяки поділу на паузах. «Баланс» — якщо ви розшифровуєте багато довгих записів.
- Ноутбук із 8 ГБ оперативної пам’яті: «Баланс» або «Швидка», якщо машина старіша.
- Старіша або малопотужна вбудована графіка: почніть зі «Швидкої». Старіших чипів ми ще не заміряли, тож сприймайте наведені вище цифри для вбудованої графіки як верхню межу того, на що вона здатна.
- Ноутбук з обома чипами: вибирати не потрібно. AlphaDictate використовує дискретний GPU, коли він доступний, і вбудований, коли дискретний вимкнено для економії енергії, і перемикається між ними в паузі між записами.
Під час першого налаштування AlphaDictate показує, яку графіку знайдено, і пропонує стартову модель: «Найкраща» на машинах із графікою NVIDIA, «Баланс» на інших. Модель пізніше можна змінити одним клацанням, і всі три входять у ціну — $39 на рік після безкоштовної години. Перевірити, що є у вашому ПК, можна в «Диспетчері завдань» на вкладці «Продуктивність», де кожен GPU показано разом із його пам’яттю.
Якщо у вас GPU, який ми не заміряли, особливо старіший вбудований чип Intel чи AMD, надішліть нам свої цифри на hello@alphadictate.com. Наша нотатка про диктування в Claude Code використовує ті самі заміри з погляду розробника.
Поширені запитання
Чи потрібен ігровий GPU для локального розпізнавання мовлення? Ні. На вбудованій графіці ноутбука 2025 року 15-секундний сказаний абзац розшифровується приблизно за дві секунди з Whisper Large v3 і менш ніж за секунду з найменшою моделлю.
Чи доведеться чекати, поки довге диктування розшифрується від самого початку? Ні. AlphaDictate розшифровує сказане на кожній паузі, поки ви говорите далі, тож після хвилини диктування з паузами очікування з найточнішою моделлю становило близько двох секунд на вбудованій графіці й пів секунди на дискретному GPU.
Скільки VRAM потрібно Whisper Large v3? Близько 2,1 ГБ у стиснутому вигляді, який використовує AlphaDictate. Whisper Medium потребує близько 1,2 ГБ, а Whisper Small — близько 0,6 ГБ.
Чи може Whisper працювати на вбудованій графіці? Так, через драйвер Vulkan. Вбудована графіка використовує системну пам’ять, тож пам’ять для моделі береться з вашої оперативної.
Чи працює AlphaDictate без GPU? Ні. Йому потрібен графічний чип із драйвером Vulkan, вбудований чи дискретний. Версія лише для процесора була в п’ять–двадцять разів повільнішою за вбудовану графіку, тож ми її не випускаємо.
Скільки часу займає локальна розшифровка години аудіо? За нашими замірами, з найточнішою моделлю — близько трьох хвилин на RTX 5070 Ti для ноутбуків і близько одинадцяти хвилин на вбудованій графіці Radeon 890M.
Цю статтю переклала з англійської машина; її перевірено на зміст, але не носієм мови. Еталонною є англійська версія.