NagibakaFrontend, боты, автоматизация

Урок

3.1 Первый инструмент - это голосовой ввод. Как настроить Spokenly для голосового ввода в любом текстовом поле для приватной работы offline

Написано человеком0% LLM

Вот мы и подобрались к практическим урокам по разработке при помощи ИИ. Начнем мы не с базовых промтов, а сделаем их ввод удобным. У голосового ввода, помимо скорости, есть еще несколько очень крутых неочевидных преимуществ. Некоторые люди относятся скептически к этому, но я вам настоятельно рекомендую просто один раз попробовать, и дальше вы от этого вряд ли сможете отказаться. Помимо диктовки промтов, вы сможете диктовать любой текст в любых программах, например, в мессенджерах и почтовых клиентах.

Неочевидные преимущества голосового ввода

00848-1841157585.png

Cовременные модели распознавания голоса стали очень сильны. Около 10 лет назад я пытался сделать системы, типа умного дома c голосовым распознаванием команд и пробовал использовать тогдашние модели, например, Vosk или встроенное распознавание в Google Chrome. Качество у них было посредственное, а если точнее, то ужасное.

Новые модели не только весьма качественно распознают текст, но и умеют раставлять знаки препинания. Однако они все равно делают ошибки, особенно при использовании сленга или каких-то специализированных терминов и аббревиатур.

Так какие бонусы дает голосовой ввод?

Улучшение дикции

Чтобы ошибок распознавания было меньше, вам придется проговаривать свои мысли более четко и медленно. Через некоторое время вы заметите, что ваша дикция улучшилась.

Более полный контекст у промтов

Общаясь с LLM, вы можете очень подробно о вашей задаче рассказывать в свободной форме, не думая о том, как это расписать более кратко и емко руками. Говорите как со своим коллегой-разработчиком, которому вы хотите поручить задачу, подробно объясняя, что сделать, как сделать, зачем и почему. Есть одна очень четкая закономерность. Когда вы наговариваете промпт голосом, вы кладете в контекст намного больше полезной информации. Проговаривая ваши опасения, цели, пожелания, приводя примеры - вы даёте LLM более полный набор условий и ограничений. Это качественно улучшает результат.

Какие системы распознавания голоса есть на рынке?

Я хочу рассмотреть популярные программы, которые умеют распознавать голос прямо на вашем устройстве offline и не зависят от облачных сервисов.

SuperWhisper

Сайт: https://superwhisper.com

Платформы: Mac, Windows, IOS

Это, наверное, самая известная программа для распознавания голоса.

Почему нам не подходит? Она платная. Несмотря на то, что программа умеет распознавать голос локально и без интернета, все равно тратятся кредиты, даже при локальном распознавании. В левом нижнем углу вы можете это увидеть.

3000 кредитов улетят достаточно быстро при активном использовании.

image.png

Handy

Сайт: https://handy.computer

Платформы: Mac, Windows, Linux

Это отличная и бесплатная программа под все основные платформы и даже под Linux, под который сложно найти нормальный софт для распознавания голоса.

Еще тут доступно скачивание большого количества разнообразных моделей. Топ!

image.png

Тут также доступна отличная модель Parakeet 0.6B v3 мультиязычная и Whisper Large v3 Turbo

Более продвинутая система распознавания голоса Spokenly

Если вам нужно только распознавание голоса - то Handy, о котором мы говорили выше, подойдет вам больше. И выбор доступных моделей у него намного больше. С другой стороны, самые топовые модели, доступны в обоих приложениях. Но, если вам нужна более качественная пост-обработка вашего голосового ввода и автоматизация, то стоит присмотреться к следующему приложению.

Сайт: https://spokenly.app/

Платформы: Mac, Windows, Linux, IOS

image.png

Чем отличается Spokenly:

  • Возможность настроить сценарий на горячую клавишу, например правый Option(Alt), чтобы распознанный текст отправлялся сразу в ваше приложение через http-ендпойнт. Если у вас есть свой ИИ-агент, то вы получаете чертовски удобный способ сразу в него передавать команды и что-то делать

  • Пост-обработка, расстановка пунктуации и заглавных букв

  • Обработка распознанного текста при помощи облачных или локальных текстовых LLM, авто-коррекция, удаление слов-паразитов, мата и чего-угодно еще.

Отличные модели:

  • NVIDIA Parakeet TDT 0.6B V3 - очень быстрая, качество приличное, жрет немного памяти, мультиязычная, размер - 496 Mb

  • NVIDIA Nemotron 3.5 Multilingual 0.6B - тоже очень быстрая и приличная по качеству модель, мультиязычная, 665 Mb

  • Whisper Large V3 Turbo(Quantized) - не такая быстрая, но намного лучшая по качеству распознавания текста, а особенно аббревиатур и специализированных терминов. Полная версия занимает 1,5 Gb. А эта квантизированная версия с минимальными потерями качества занимает намного меньше места и работает сильно быстрее оригинальной модели. Мультиязычная, 547 Mb

Настройки:

Качаете модель и выбираете её. У меня две модели Parakeet+Whisper - я между ними переключаюсь. Для больших промтов Whisper распознает лучше и исправлять текст приходится значительно меньше.

Далее рекомендую зайти в настройки в General settings - пролистать в самый низ и отметить Local-only mode. Теперь вы можете пользоваться программой безлимитно, используя локальную модель.

image.png

Я пробовал все режимы активации и самый удобный.- это режим рации(Push-to-talk) по горячей клавише - правый Command(Control). Пока клавиша нажата - вы говорите текст, а когда отпускаете, он распознается и вставляется в поле ввода сам.

Также обратите на переключатели в разделе Text Handling.

Настройка Recording Shortcut - режим Hold и хоткей Right Command

image.png

На этом всё.

Голосовой ввод очень сильно забустит вас. Пробуйте!