Урок
3.1 Первый инструмент - это голосовой ввод. Как настроить Spokenly для голосового ввода в любом текстовом поле для приватной работы offline
Вот мы и подобрались к практическим урокам по разработке при помощи ИИ. Начнем мы не с базовых промтов, а сделаем их ввод удобным. У голосового ввода, помимо скорости, есть еще несколько очень крутых неочевидных преимуществ. Некоторые люди относятся скептически к этому, но я вам настоятельно рекомендую просто один раз попробовать, и дальше вы от этого вряд ли сможете отказаться. Помимо диктовки промтов, вы сможете диктовать любой текст в любых программах, например, в мессенджерах и почтовых клиентах.
Неочевидные преимущества голосового ввода

Cовременные модели распознавания голоса стали очень сильны. Около 10 лет назад я пытался сделать системы, типа умного дома c голосовым распознаванием команд и пробовал использовать тогдашние модели, например, Vosk или встроенное распознавание в Google Chrome. Качество у них было посредственное, а если точнее, то ужасное.
Новые модели не только весьма качественно распознают текст, но и умеют раставлять знаки препинания. Однако они все равно делают ошибки, особенно при использовании сленга или каких-то специализированных терминов и аббревиатур.
Так какие бонусы дает голосовой ввод?
Улучшение дикции
Чтобы ошибок распознавания было меньше, вам придется проговаривать свои мысли более четко и медленно. Через некоторое время вы заметите, что ваша дикция улучшилась.
Более полный контекст у промтов
Общаясь с LLM, вы можете очень подробно о вашей задаче рассказывать в свободной форме, не думая о том, как это расписать более кратко и емко руками. Говорите как со своим коллегой-разработчиком, которому вы хотите поручить задачу, подробно объясняя, что сделать, как сделать, зачем и почему. Есть одна очень четкая закономерность. Когда вы наговариваете промпт голосом, вы кладете в контекст намного больше полезной информации. Проговаривая ваши опасения, цели, пожелания, приводя примеры - вы даёте LLM более полный набор условий и ограничений. Это качественно улучшает результат.
Какие системы распознавания голоса есть на рынке?
Я хочу рассмотреть популярные программы, которые умеют распознавать голос прямо на вашем устройстве offline и не зависят от облачных сервисов.
SuperWhisper
Сайт: https://superwhisper.com
Платформы: Mac, Windows, IOS
Это, наверное, самая известная программа для распознавания голоса.
Почему нам не подходит? Она платная. Несмотря на то, что программа умеет распознавать голос локально и без интернета, все равно тратятся кредиты, даже при локальном распознавании. В левом нижнем углу вы можете это увидеть.
3000 кредитов улетят достаточно быстро при активном использовании.

Handy
Сайт: https://handy.computer
Платформы: Mac, Windows, Linux
Это отличная и бесплатная программа под все основные платформы и даже под Linux, под который сложно найти нормальный софт для распознавания голоса.
Еще тут доступно скачивание большого количества разнообразных моделей. Топ!

Тут также доступна отличная модель Parakeet 0.6B v3 мультиязычная и Whisper Large v3 Turbo
Более продвинутая система распознавания голоса Spokenly
Если вам нужно только распознавание голоса - то Handy, о котором мы говорили выше, подойдет вам больше. И выбор доступных моделей у него намного больше. С другой стороны, самые топовые модели, доступны в обоих приложениях. Но, если вам нужна более качественная пост-обработка вашего голосового ввода и автоматизация, то стоит присмотреться к следующему приложению.
Сайт: https://spokenly.app/
Платформы: Mac, Windows, Linux, IOS

Чем отличается Spokenly:
Возможность настроить сценарий на горячую клавишу, например правый Option(Alt), чтобы распознанный текст отправлялся сразу в ваше приложение через http-ендпойнт. Если у вас есть свой ИИ-агент, то вы получаете чертовски удобный способ сразу в него передавать команды и что-то делать
Пост-обработка, расстановка пунктуации и заглавных букв
Обработка распознанного текста при помощи облачных или локальных текстовых LLM, авто-коррекция, удаление слов-паразитов, мата и чего-угодно еще.
Отличные модели:
NVIDIA Parakeet TDT 0.6B V3 - очень быстрая, качество приличное, жрет немного памяти, мультиязычная, размер - 496 Mb
NVIDIA Nemotron 3.5 Multilingual 0.6B - тоже очень быстрая и приличная по качеству модель, мультиязычная, 665 Mb
Whisper Large V3 Turbo(Quantized) - не такая быстрая, но намного лучшая по качеству распознавания текста, а особенно аббревиатур и специализированных терминов. Полная версия занимает 1,5 Gb. А эта квантизированная версия с минимальными потерями качества занимает намного меньше места и работает сильно быстрее оригинальной модели. Мультиязычная, 547 Mb
Настройки:
Качаете модель и выбираете её. У меня две модели Parakeet+Whisper - я между ними переключаюсь. Для больших промтов Whisper распознает лучше и исправлять текст приходится значительно меньше.
Далее рекомендую зайти в настройки в General settings - пролистать в самый низ и отметить Local-only mode. Теперь вы можете пользоваться программой безлимитно, используя локальную модель.

Я пробовал все режимы активации и самый удобный.- это режим рации(Push-to-talk) по горячей клавише - правый Command(Control). Пока клавиша нажата - вы говорите текст, а когда отпускаете, он распознается и вставляется в поле ввода сам.
Также обратите на переключатели в разделе Text Handling.
Настройка Recording Shortcut - режим Hold и хоткей Right Command

На этом всё.
Голосовой ввод очень сильно забустит вас. Пробуйте!
