Свободная кроссплатформенная утилита для голосового ввода текста прямо в любое приложение Linux. Работает полностью офлайн, поддерживает три движка распознавания, ускорение на GPU и горячие клавиши. Я заценил 😌.
🖐️Эй!
Подписывайтесь на наш телеграм @r4ven_me📱, чтобы не пропустить новые публикации на сайте😉. А если есть вопросы или желание пообщаться по тематике — заглядывайте в Вороний чат @r4ven_me_chat🧐.
Также в блоге теперь доступно соавторство 🐧🐧🐧.
Предисловие
VocaLinux - это программа с открытым исходным кодом (GPLv3), которая позволяет диктовать текст в любое приложение. Есть готовые сборки для Linux 🐧, macOS или Windows. Распознавание речи работает полностью офлайн, доступны три встроенных движка (whisper.cpp, OpenAI Whisper, VOSK), автоматическое ускорение на GPU через Vulkan и настраиваемые горячие клавиши.

Я терпеть не могу голосовые сообщения в мессенджерах. Поэтому набор голосом для меня в диковинку. Но, не смотря на это, я иногда пользовался голосовым набором в приложениях типа ChatGPT или Claude.
И тут мне на глаза попался данный софт. Идея конфиденциального и универсального голосового ввода с распознованием на базе ИИ выглядела достаточно интересно. Относительно неплохой внешний микрофон (Fifine) у меня есть, вот и решил попробовать. Спойлер: мне понравилось. Но голосовые я так и не записываю, если что 😑.
Немного про движки распознавания
Прежде чем переходить к установке, коротко поговорим про доступные движки распознавания, которые предлагает VocaLinux:
- whisper.cpp - быстрая и легковесная реализация модели Whisper от OpenAI на C++. Хорошо работает на CPU и GPU, потребляет меньше памяти, чем оригинальная реализация. По умолчанию это выбор инсталлятора.
- OpenAI Whisper - оригинальная реализация на Python. Точнее распознаёт, но требует больше ресурсов. Если у вас мощный GPU - имеет смысл попробовать.
- VOSK - компактный локальный движок на основе Kaldi. Самый быстрый на слабых машинах, но менее точный. Если нужна максимальная оперативность и память критична - выбирайте его.
Вводные данные
В этой статье использовалось:
| ПО | Версия |
|---|---|
| Linux Mint | 22.3 |
| VocaLinux | 0.10.1-beta |
Установка VocaLinux

Скрипт установки VocaLinux лежит на GitHub. Бездумно его не запускаем, а обязательно проверяем его содержимое через VirusTotal с помощью утилиты vt-cli, о которой говорили в прошлый раз:
vt scan file <(curl -Ls https://raw.githubusercontent.com/jatinkrmalik/vocalinux/main/install.sh) --wait
Если сканирование показало, что скрипт чист, скачиваем его и запускаем в интерактивном режиме:
curl -fsSL https://raw.githubusercontent.com/jatinkrmalik/vocalinux/main/install.sh -o /tmp/vl.sh
bash /tmp/vl.sh --interactiveИнсталлятор выполняет следующее (описание с оф. сайта):
- устанавливает системные зависимости из стандартных репозиториев;
- создаёт изолированное виртуальное окружение (
venv) Python; - загружает модели распознавания по выбору;
- настраивает интеграцию с рабочим столом и переменные
PATH; - создаёт Desktop файл (аля ярлык для приложения).
Запуск начнётся с выбора движка речи. Если всё нормально, увидим примерно такой экран:

Выбор движка распознавания
По умолчанию предлагается whisper.cpp, и это хороший выбор для большинства случаев. Но имеет смысл попробовать и оригинальный Whisper от OpenAI - он обычно точнее (но тяжеловеснее):

💡 Если вы уже установили Whisper.cpp и потом решили попробовать OpenAI Whisper, просто запустите интерактивный инсталлятор ещё раз:
bash /tmp/vl.sh --interactiveУскорение на GPU
Следующий важный выбор - нужно ли использовать GPU для ускорения. Если у вас есть видеокарта с поддержкой Vulkan (большинство современных AMD и NVIDIA), то однозначно включаем:

С GPU распознавание работает в разы быстрее.
Загрузка модели
На этом этапе инсталлятор начнёт загружать выбранную модель распознавания. Процесс может занять некоторое время в зависимости от выбора модели и скорости интернета:

После загрузки модели подтверждаем установку нажатием Enter:

Дальше инсталлятор установит оставшиеся зависимости из репозиториев и несколько пакетов через pip:

Всё, установка закончилась. VocaLinux готов к работе.

Первый запуск и настройка

После установки запускаем приложение из главного меню:

Нам сразу предложат настроить автозапуск при входе:

Чтобы попасть в настройки программы, находим иконку в системном трее, кликаем по ней и выбираем “Settings”:

Вкладка “Speech Engine”
Тут можно выбрать движок, язык и веса модели: “tiny”, “base”, “small”, “medium”, “large”:

Выберем “Small”. После выбора начнётся автоматическое скачивание:

Вкладка “Recognition”
На этой вкладке можно задать несколько тонких настроек и провести тест распознавания:

Вкладка “Audio”
Тут можно явно указать, какое аудио устройство использовать для записи голоса:

Вкладка “Hotkeys”
На этой вкладке мы определяем, как будет активироваться распознавание:

По умолчанию включён режим “toggle” (включить-выключить одной клавишей) но я предпочитаю второй вариант: активацию по зажатию, например, правого Control (режим “push-to-talk”). Для меня это оправдано, т. к. эту клавишу я почти никогда не использую.
Вкладка “General”
На последней вкладке можно вновь настроить автозапуск и включить автоматическое копирование распознанного текста в буфер обмена:

Уверен, что последняя опция для кого-то окажется особенно удобной 😉.
Тестирование
Переходим в любое приложение с текстовым полем и тестируем распознавание. Нажимаем горячую клавишу и начинаем говорить:

📝 Если вы мизантроп, как я, то вам сперва будет неловко, но потом привыкните 😅.
После того как закончите говорить или отпустите клавишу, VocaLinux автоматически вставит распознанный текст в активное окно. Обработка происходит локально, на вашей машине, никакие данные не передаются куда-то в сеть 😌.
Индикатор состояния
Обратите внимание на цвет иконки в трее - это визуальный индикатор состояния:
- Красный - приложение отключено;
- Зелёный - идёт запись голоса;
- Жёлтый - идёт обработка и распознавание текста.
Послесловие
В распознавании голосом есть свои плюсы. Если вы, как и я, регулярно общаетесь набором текста, то набор голосом заставит ваш мозг работать немного по другому: придётся тренировать навык формирования логически связанного текста прямо на ходу 🙄. Ну а VocaLinux поможет вам в этом.
К слову, проект активно разрабатывается - автор регулярно чинит баги и добавляет функции. Если вам понравилось - поставьте звезду на GitHub.
Спасибо, что читаете. Успехов в изучении открытых инструментов! 🐧
Полезные материалы
- https://vocalinux.com/
- https://github.com/jatinkrmalik/vocalinux
- https://vocamac.com/
- https://vocawin.com/
- https://github.com/ggml-org/whisper.cpp
- https://github.com/openai/whisper
- https://github.com/alphacep/vosk-api
👨💻Ну и…
Не забывайте про нашу телегу📱и чат 💬
Или может хотите стать соавтором? Тогда клик сюда🔗
Всех благ✌️
That should be it. If not, check the logs 🙂



Комментарии