Домой Гайды Как протестировать новую функцию голосового ввода Myna на базе ИИ в Ubuntu

Как протестировать новую функцию голосового ввода Myna на базе ИИ в Ubuntu

Инструкция по установке и тестированию нового локального инструмента голосового ввода Myna на базе искусственного интеллекта в Ubuntu 26.04 LTS и Ubuntu 26.10.

1
0

Новый инструмент голосового ввода Myna на базе искусственного интеллекта пока не готов к официальному релизу, однако пользователи могут протестировать его уже сейчас. Компания Canonical добавила оркестратор snap и пару ИИ-моделей распознавания речи в Snap Store, а также выпустила настольное приложение Myna Settings для тестирования через PPA. В Ubuntu 26.10 также предварительно установлен пакет gnome-shell-ubuntu-extensions, содержащий расширение GNOME Shell. Оно вызывает экранный HUD, когда локальная ИИ-технология преобразования речи в текст Myna выполняет прослушивание или транскрипцию. Официальный призыв к тестированию еще не объявлен, но все необходимые компоненты уже доступны для самостоятельной сборки.

Инструмент Myna в работе на операционной системе Ubuntu 26.10
Инструмент Myna в работе на Ubuntu 26.10

Что нужно для тестирования Myna

Для проверки работы инструмента на Ubuntu 26.04 LTS или Ubuntu 26.10 понадобятся настольное приложение myna-config из PPA, пакет myna из Snap Store и ИИ-модель myna-* также из Snap Store. Пользователи Ubuntu 26.10 дополнительно имеют предустановленное расширение Myna Shell. На момент написания материала расширение Myna Shell, выводящее экранный HUD, упаковано только для GNOME 51 и 26.10. На Ubuntu 26.04 для передачи статуса используются системные уведомления.

Интерфейс настраиваемого экранного HUD появляется исключительно после нажатия триггерной клавиши активации Myna во время прослушивания, транскрипции или при возникновении ошибок (например, при высоком уровне фонового шума или потере фокуса). Пользователям доступны различные визуальные стили HUD: стандартный в виде простой полосы с акцентным цветом системы, индикатор громкости vumeter, лента ribbon, а также полоса bar, которая похожа на стандартную, но в тестах лишена желоба.

Порядок установки компонентов

Для установки приложения Myna Settings следует добавить специальный PPA, который поддерживается инженером Canonical, работающим над проектом, и предоставляет пакеты для Ubuntu 26.04 LTS и 26.10:

sudo add-apt-repository ppa:charles05/myna-configsudo apt install myna-config

Затем требуется включить экспериментальную функцию snap, необходимую для работы Myna:

sudo snap set system experimental.user-daemons=true

После этого устанавливается клиент распознавания речи Myna из магазина Snap Store:

голосового ввода Myna — иллюстрация 2 к материалу
Варианты визуального оформления экранного HUD

sudo snap install myna —edge

На финальном этапе инсталляции необходимо загрузить ИИ-модель для перевода аудио в текст. Если открыть утилиту настройки Myna Settings (myna-confg) сразу, она предложит подходящую под конкретное аппаратное обеспечение модель. Однако нажатие на кнопку установки вызовет ошибку, поскольку инструмент ссылается на стабильные версии, поэтому модель устанавливается вручную. Локальные ИИ-модели Whisper и Parakeet уже доступны в Snap Store, а появление Funasr ожидается в ближайшее время. Модели работают полностью локально на устройстве и требуют от 1 до 2 ГБ свободного дискового пространства в зависимости от выбранного варианта.

Для установки Parakeet — быстрой модели ASR с открытыми весами от NVIDIA, поддерживающей 25 языков и пунктуацию, используется команда:

sudo snap install myna-parakeet —edge

Для установки мультиязычной модели с открытым исходным кодом Whisper от OpenAI применяется следующая команда:

голосового ввода Myna — иллюстрация 3 к материалу
Приложение Myna Settings для операционной системы Ubuntu

sudo snap install myna-whisper —edge

После завершения установки следует открыть Myna Settings — программа пропустит этапы настройки и сразу перейдет к параметрам.

Особенности работы и проверка функции

Перед началом детального изучения возможностей рекомендуется сразу протестировать диктовку. В конфигурационном приложении задается комбинация горячих клавиш, после чего нужно сфокусироваться на любом текстовом поле и нажать назначенную клавишу. В Ubuntu 26.10 при активации появится HUD, а в версии 26.04 — уведомление. После появления сообщения о прослушивании можно надиктовывать текст, а по окончании повторно нажать ту же горячую клавишу. Обработанные слова появятся в активном приложении.

Тестирование моделей Parakeet и Whisper показало, что первая демонстрирует более высокую точность распознавания, безошибочно справляясь даже со сложными фамилиями, тогда как вторая работает быстрее. Приложение myna-config позволяет переключаться между моделями, выбирая уменьшенные или увеличенные варианты.

голосового ввода Myna — иллюстрация 4 к материалу
Параметры бэкенда и выбор ИИ-моделей в настройках

Новый инструмент повышает доступность Ubuntu за счет автономного голосового ввода повышенной точности. При этом диктовка лучше всего подходит для ввода больших объемов текста, а не для коротких команд. Программа может легко терять фокус при открытии других окон или кликах мыши, прерывая обработку текущей речи. Функция работает опционально: система слушает только при нажатии кнопки, а записанные фрагменты не покидают устройство и не сохраняются на нем. Активация голосом по аналогии сфразой «hey myna» на данный момент не поддерживается. Разработчики Canonical развивают технологию как независимую от окружения рабочих столов, хотя первая реализация ориентирована на стек GNOME, Wayland и Mutter.

Нюансы тестирования и советы по настройке

Важно учитывать, что система Snap по умолчанию сохраняет резервную копию каждого установленного компонента. Это означает, что при обновлении «старая» версия пакета остается в памяти, из-за чего каждый установленный снап-пакет Myna в итоге занимает в два раза больше дискового пространства, чем заявлено изначально.

Что касается настройки горячих клавиш, стоит проявить гибкость: в зависимости от конфигурации конкретного устройства, Myna может по умолчанию предлагать разные комбинации, например Super + J или Super + T. Вы можете проверить или изменить назначенную клавишу активации в приложении Myna Settings.

Несмотря на многообещающие возможности, инструмент пока находится на ранней стадии разработки и требует определенной осторожности:

  • Неожиданные сбои: Не стоит ожидать идеальной работы компонентов на данном этапе. Процесс тестирования может сопровождаться ошибками, которые Myna отображает через экранный HUD (например, уведомление о потере фокуса или чрезмерно высоком уровне фонового шума).
  • Чувствительность к контексту: Инструмент крайне чувствителен к потере фокуса. Если в момент транскрипции вы кликнете мышью в другом месте или откроется стороннее окно, текущий «поток» речи, который Myna пытается обработать, может быть прерван.
  • Особенности визуализации: В отличие от стандартного стиля, который использует системный акцентный цвет, стиль оформления bar в текущей реализации выглядит как полоса без желоба (trough), что может визуально отличаться от задуманного разработчиками вида.

Несмотря на эти ограничения, развитие проекта Canonical — значимый шаг для экосистемы Ubuntu. Учитывая, что технология создается как десктоп-агностическая, это закладывает фундамент для внедрения продвинутого локального распознавания речи даже за пределами текущего стека GNOME, Wayland и Mutter.

Источник: https://www.omgubuntu.co.uk