Vocalinux - Универсальный голосовой ввод в Linux, MacOS и Windows
Приветствую!

Свободная кроссплатформенная утилита для голосового ввода текста прямо в любое приложение Linux. Работает полностью офлайн, поддерживает три движка распознавания, ускорение на GPU и горячие клавиши. Я заценил 😌.

Предисловие

VocaLinux - это программа с открытым исходным кодом (GPLv3), которая позволяет диктовать текст в любое приложение. Есть готовые сборки для Linux 🐧, macOS или Windows. Распознавание речи работает полностью офлайн, доступны три встроенных движка (whisper.cpp, OpenAI Whisper, VOSK), автоматическое ускорение на GPU через Vulkan и настраиваемые горячие клавиши.

Я терпеть не могу голосовые сообщения в мессенджерах. Поэтому набор голосом для меня в диковинку. Но, не смотря на это, я иногда пользовался голосовым набором в приложениях типа ChatGPT или Claude.

И тут мне на глаза попался данный софт. Идея конфиденциального и универсального голосового ввода с распознованием на базе ИИ выглядела достаточно интересно. Относительно неплохой внешний микрофон (Fifine) у меня есть, вот и решил попробовать. Спойлер: мне понравилось. Но голосовые я так и не записываю, если что 😑.

Немного про движки распознавания

Прежде чем переходить к установке, коротко поговорим про доступные движки распознавания, которые предлагает VocaLinux:

Вводные данные

В этой статье использовалось:

ПОВерсия
Linux Mint22.3
VocaLinux0.10.1-beta

Установка VocaLinux

Скрипт установки VocaLinux лежит на GitHub. Бездумно его не запускаем, а обязательно проверяем его содержимое через VirusTotal с помощью утилиты vt-cli, о которой говорили в прошлый раз:

BASH
vt scan file <(curl -Ls https://raw.githubusercontent.com/jatinkrmalik/vocalinux/main/install.sh) --wait
Нажмите, чтобы развернуть и увидеть больше

Если сканирование показало, что скрипт чист, скачиваем его и запускаем в интерактивном режиме:

BASH
curl -fsSL https://raw.githubusercontent.com/jatinkrmalik/vocalinux/main/install.sh -o /tmp/vl.sh

bash /tmp/vl.sh --interactive
Нажмите, чтобы развернуть и увидеть больше

Инсталлятор выполняет следующее (описание с оф. сайта):

Запуск начнётся с выбора движка речи. Если всё нормально, увидим примерно такой экран:

Выбор движка распознавания

По умолчанию предлагается whisper.cpp, и это хороший выбор для большинства случаев. Но имеет смысл попробовать и оригинальный Whisper от OpenAI - он обычно точнее (но тяжеловеснее):

Ускорение на GPU

Следующий важный выбор - нужно ли использовать GPU для ускорения. Если у вас есть видеокарта с поддержкой Vulkan (большинство современных AMD и NVIDIA), то однозначно включаем:

С GPU распознавание работает в разы быстрее.

Загрузка модели

На этом этапе инсталлятор начнёт загружать выбранную модель распознавания. Процесс может занять некоторое время в зависимости от выбора модели и скорости интернета:

После загрузки модели подтверждаем установку нажатием Enter:

Дальше инсталлятор установит оставшиеся зависимости из репозиториев и несколько пакетов через pip:

Всё, установка закончилась. VocaLinux готов к работе.

Первый запуск и настройка

После установки запускаем приложение из главного меню:

Нам сразу предложат настроить автозапуск при входе:

Чтобы попасть в настройки программы, находим иконку в системном трее, кликаем по ней и выбираем “Settings”:

Вкладка “Speech Engine”

Тут можно выбрать движок, язык и веса модели: “tiny”, “base”, “small”, “medium”, “large”:

Выберем “Small”. После выбора начнётся автоматическое скачивание:

Вкладка “Recognition”

На этой вкладке можно задать несколько тонких настроек и провести тест распознавания:

Вкладка “Audio”

Тут можно явно указать, какое аудио устройство использовать для записи голоса:

Вкладка “Hotkeys”

На этой вкладке мы определяем, как будет активироваться распознавание:

По умолчанию включён режим “toggle” (включить-выключить одной клавишей) но я предпочитаю второй вариант: активацию по зажатию, например, правого Control (режим “push-to-talk”). Для меня это оправдано, т. к. эту клавишу я почти никогда не использую.

Вкладка “General”

На последней вкладке можно вновь настроить автозапуск и включить автоматическое копирование распознанного текста в буфер обмена:

Уверен, что последняя опция для кого-то окажется особенно удобной 😉.

Тестирование

Переходим в любое приложение с текстовым полем и тестируем распознавание. Нажимаем горячую клавишу и начинаем говорить:

После того как закончите говорить или отпустите клавишу, VocaLinux автоматически вставит распознанный текст в активное окно. Обработка происходит локально, на вашей машине, никакие данные не передаются куда-то в сеть 😌.

Индикатор состояния

Обратите внимание на цвет иконки в трее - это визуальный индикатор состояния:

Послесловие

В распознавании голосом есть свои плюсы. Если вы, как и я, регулярно общаетесь набором текста, то набор голосом заставит ваш мозг работать немного по другому: придётся тренировать навык формирования логически связанного текста прямо на ходу 🙄. Ну а VocaLinux поможет вам в этом.

К слову, проект активно разрабатывается - автор регулярно чинит баги и добавляет функции. Если вам понравилось - поставьте звезду на GitHub.

Спасибо, что читаете. Успехов в изучении открытых инструментов! 🐧

Полезные материалы

Комментарии

Авторские права

Автор: Иван Чёрный

Ссылка: https://r4ven.me/software/vocalinux-universalnyy-golosovoy-vvod-v-linux-macos-i-windows/

Лицензия: CC BY-NC-SA 4.0

Использование материалов блога разрешается при условии: указания авторства/источника, некоммерческого использования и сохранения лицензии.

Начать поиск

Введите ключевые слова для поиска статей

↑↓
ESC
⌘K Горячая клавиша