Блог / Диктуємо в Claude Code у Windows

Диктуємо в Claude Code у Windows: що надсилає /voice і локальний шлях

Розмова з агентом для програмування — це перший вид диктування, якого багатьом розробникам узагалі захотілося. Промпти довгі, розмовні й повні фраз на кшталт «перепиши auth middleware», і набирати їх довше, ніж сказати. Тепер Claude Code має голосовий режим, і він добрий. У цій статті пояснено, що саме він робить із вашим аудіо і де зупиняється, а також наведено заміри для альтернативи: клавіші диктування, яка працює в кожному терміналі, полі чату й редакторі на комп’ютері, а модель розпізнавання мовлення запускає на вашому власному GPU.

Що робить голосовий режим Claude Code

Вмикається він командою /voice. У типовому режимі hold ви тримаєте пробіл, поки говорите; у режимі tap натискаєте один раз, щоб почати, і ще раз, щоб надіслати. Розшифровка з’являється в рядку введення просто під час мовлення, приглушена, доки не стане остаточною, і в одному повідомленні можна змішувати набір і голос. Запис зупиняється сам після п’ятнадцяти секунд тиші або двох хвилин загалом. Розпізнавання налаштоване на лексику коду, а Claude Code непомітно додає назву вашого проєкту й гілку git як підказки для розпізнавання — дотепне рішення. На ліміти використання воно не впливає.

А тепер те, що власна документація Anthropic прямо пише в першій же вимозі: «Голосове диктування передає записане аудіо на сервери Anthropic для розшифровки. Аудіо не обробляється локально». З цього речення випливають три наслідки, і всі вони розписані на тій самій сторінці.

  • Потрібен обліковий запис claude.ai. Служба розпізнавання мовлення недоступна, коли Claude Code працює через ключ API, Amazon Bedrock, Agent Platform від Google Cloud або Microsoft Foundry. Корпоративні конфігурації, які обрали ці шляхи через вимоги до розташування даних, голосового режиму не отримують — це послідовно, хоч і незручно.
  • Потрібен локальний мікрофон. Голосу немає в сеансах SSH, у Claude Code у вебі, у VS Code Remote, Dev Containers і Codespaces, а також у WSL1.
  • Він знає двадцять мов, але лише по одній за раз. Диктування йде за налаштуванням language і типово англійське. Поставте польську — і диктуйте польською; заговоріть польською, коли налаштовано англійську, — і розшифровка буде сміттям, як зазначено в розділі про усунення несправностей. Автоматичного визначення мови немає.

Ніщо з цього не є критикою інженерної роботи. Це опис архітектури: дуже добра хмарна служба розшифровки, вбудована в один застосунок і доступна одному типу облікових записів.

Де він зупиняється для розробника за роботою

Умови щодо облікового запису й мережі для одних важливі, для інших ні. Дві межі зачіпають усіх.

Він працює лише в рядку введення Claude Code. Щойно ви перемикаєтеся на сеанс Codex, чат у Cursor, issue на GitHub у браузері, повідомлення коміту в редакторі чи гілку в Slack, голос зникає. Розробники, які говорять з агентами, рідко говорять лише з одним.

Аудіо залишає комп’ютер. Для особистого пет-проєкту це нікого не хвилює. Для кодової бази клієнта під NDA, для роботодавця з регульованої галузі чи просто для розробника, який свідомо обрав локальні моделі, це межа. Деякі організації вже вимкнули цю функцію політикою, і Claude Code повідомляє про це так: «Voice mode is disabled by your organization's policy».

Локальна альтернатива в цифрах

Загальносистемна клавіша диктування обходить обидві межі: натисніть її в будь-якому вікні, говоріть, натисніть ще раз — і текст з’явиться там, де був курсор, розшифрований моделлю Whisper на вашій власній відеокарті. Очевидне питання — чи достатньо швидка локальна розшифровка, щоб це відчувалося як розмова. Ми заміряли власний рушій, той, що працює в AlphaDictate, на ноутбуці, на якому написано цю статтю: у ньому є дискретна відеокарта NVIDIA RTX 5070 Ti для ноутбуків і вбудована графіка AMD Radeon 890M. Кліп — 77 секунд синтезованого англійського мовлення про продуктову нараду, нарізаний на записи типової тривалості; кожне число — медіана трьох прогонів через рушій, який постачається із застосунком, без частки секунди, яку займає сама вставка.

Тривалість запису«Швидка», дискретна«Найкраща», дискретна«Швидка», вбудована«Найкраща», вбудована
5 секунд0,13 с0,29 с0,31 с1,2 с
15 секунд0,30 с0,77 с0,64 с2,0 с
60 секунд1,6 с3,0 с2,7 с9,3 с

Модель завантажується в GPU один раз, і це тривало від однієї до двох з половиною секунд залежно від її розміру. Типовий промпт для агента — це десять–двадцять секунд мовлення, тож на дискретному GPU текст з’являється менш ніж за секунду після того, як ви замовкли, навіть із найточнішою моделлю, а на вбудованому — приблизно за дві секунди або помітно швидше за секунду, якщо вибрати модель «Швидка». Хмарне диктування з урахуванням дороги до сервера й назад відчутно швидшим не буде, а локальне не сповільнюється через погане з’єднання.

Довші записи рідко чекають навіть стільки: AlphaDictate розшифровує сказане на кожній паузі, поки ви говорите далі, тож після хвилини диктування з паузами лишається тільки останній відрізок — приблизно пів секунди на дискретному GPU і дві секунди на вбудованому з найточнішою моделлю. Ці цифри є в нашій статті про GPU.

Два чесні застереження. Синтезоване мовлення чистіше, ніж людина, яка бурмоче в мікрофон ноутбука, тож цей тест вимірює не точність, а затримку. А дані для вбудованого GPU отримано на ноутбуці 2025 року; старіша вбудована графіка буде повільнішою, тому застосунок пропонує три розміри моделей і під час першого запуску каже, яку з них потягне ваше обладнання.

Проблема з терміналом, про яку ніхто не згадує

Кожен інструмент для диктування у Windows, зокрема наш, передає текст у термінал однаково: кладе розшифровку в буфер обміну й надсилає команду вставлення. Windows Terminal, термінал VS Code і консоль, у якій працює Claude Code, приймають Ctrl+V, тож це працює. Дві речі це ламають — і ламають для кожного інструмента.

Перша — термінал із підвищеними правами. Якщо ви запускаєте оболонку від імені адміністратора, Windows мовчки відкидає натискання клавіш, які імітує програма зі звичайними правами, і вставка ніби нічого не робить — без жодної помилки. AlphaDictate перевіряє це перед вставкою і повідомляє, що текст у буфері обміну, щоб ви натиснули Ctrl+V самі, а не втратили запис. Друга — сам буфер обміну: вставка замінює те, що ви скопіювали раніше. Ми свідомо залишаємо розшифровку в буфері обміну, щоб вставка, яка з будь-якої причини не вдалася, була на відстані одного Ctrl+V, а кожен запис до того ж зберігається в локальній історії застосунку. Якщо ви диктуєте посеред копіювання чогось цінного, скопіюйте це ще раз після диктування. Такий компроміс, і ми воліємо сказати про нього тут, ніж щоб ви натрапили на нього самі.

Як налаштувати локальну клавішу диктування для роботи з агентами

  1. Установіть локальний застосунок для диктування й дайте йому завантажити модель. Виберіть модель «Швидка», якщо у вас вбудована графіка й потрібен результат швидше ніж за секунду; на дискретному GPU виберіть «Найкраща».
  2. Призначте на нього клавішу, яку можна натиснути не дивлячись. Для роботи з агентами ідеальна бічна кнопка миші: рука на миші, натиснули, сказали, натиснули — промпт заповнено.
  3. Залиште автоматичне визначення мови, якщо думаєте кількома мовами. Whisper піде за вами навіть посеред речення.
  4. Один раз додайте незвичні слова свого проєкту в підказку словника: назви внутрішніх сервісів, бібліотеку, яку ви постійно згадуєте, прізвище співзасновника.
  5. Якщо вам подобається, як голосовий режим Claude Code друкує текст наживо, залиште ввімкненим і його. Вони не конфліктують: один — це клавіша в одному застосунку, другий — клавіша всюди.

Ми робимо AlphaDictate, тож читайте цю рекомендацію з поправкою на це. Безкоштовна альтернатива в тій самій категорії — Handy, локальний застосунок для диктування з відкритим кодом: можливостей у нього менше, зате він нічого не коштує. Наша попередня нотатка про голосовий ввід Windows описує вбудований варіант, який теж надсилає аудіо на сервер і теж обмежується однією мовою.


Поширені запитання

Чи обробляє голосовий режим Claude Code аудіо локально? Ні. У документації Anthropic сказано, що аудіо передається на сервери Anthropic для розшифровки і локально не обробляється.

Чому /voice каже, що потрібен обліковий запис Claude.ai? Служба перетворення мовлення на текст доступна лише для входу через claude.ai. Сеанси Claude Code, автентифіковані ключем API або через Bedrock, Agent Platform від Google Cloud чи Microsoft Foundry, не можуть нею користуватися.

Чи можна диктувати в Claude Code через SSH? Не вбудованим голосовим режимом — йому потрібен локальний мікрофон. Загальносистемний застосунок для диктування, запущений на вашому локальному комп’ютері, друкує в термінал SSH так само, як у будь-яке інше вікно.

Які мови підтримує голосовий режим Claude Code? Двадцять, зокрема англійську, німецьку, французьку, іспанську, португальську, польську, японську, корейську й українську. Мову вибирають у налаштуванні, а не визначають автоматично.

Наскільки швидке локальне диктування на ноутбуці? На ноутбуці, який ми заміряли, п’ятнадцятисекундний запис розшифровувався з найточнішою моделлю менш ніж за секунду на дискретному GPU і приблизно за дві секунди на вбудованому — або менш ніж за секунду з моделлю «Швидка».

Чи працює диктування в терміналі, запущеному від імені адміністратора? Вікна з підвищеними правами у Windows ігнорують імітовану вставку, хоч би який інструмент її надсилав. AlphaDictate це виявляє і залишає текст у буфері обміну, щоб ви вставили його вручну через Ctrl+V.

Цю статтю переклала з англійської машина; її перевірено на зміст, але не носієм мови. Еталонною є англійська версія.