Домой Новости Софт и сервисы Canonical представила Myna — локальную систему преобразования речи в текст для Ubuntu...

Canonical представила Myna — локальную систему преобразования речи в текст для Ubuntu Desktop

Новый инструмент от разработчиков Ubuntu позволит диктовать текст прямо в приложения, не отправляя данные в облака.

Интерфейс системы распознавания речи Myna
Canonical разрабатывает Myna как легкий инструмент диктовки Источник: linux.org.ru

Компания Canonical анонсировала проект Myna — новую систему для преобразования речи в текст, предназначенную для использования в Ubuntu Desktop. Ключевая концепция разработки заключается в реализации функции встроенной диктовки: пользователь задействует горячую клавишу, надиктовывает текст, и тот мгновенно появляется в активном окне приложения. Разработчики делают упор на то, чтобы инструмент ощущался как неотъемлемая часть операционной системы, при этом строго придерживаясь принципов конфиденциальности.

Первые шаги: ориентир на Ubuntu 26.10

В текущих планах Canonical не значится создание полноценного голосового ассистента или системы управления интерфейсом с помощью команд. Вместо этого команда сфокусировалась на создании базового, надежного инструмента для диктовки. Целевой платформой для первой версии выбрана Ubuntu Desktop на базе Wayland с графическим окружением GNOME, однако архитектура системы закладывается как открытая для последующей интеграции с другими средами рабочего стола.

Приватность и локальная обработка

Главная особенность Myna заключается в полностью локальном распознавании речи. После загрузки необходимых моделей работа функции не требует интернет-соединения. Обработка аудиопотока происходит непосредственно в оперативной памяти устройства, а после завершения транскрибации данные удаляются — отправка записей на сторонние облачные серверы исключена. Проектная спецификация прямо запрещает использование облачных сервисов по умолчанию.

Технические возможности и функции

Исходный код проекта и сопутствующая документация уже доступны в репозитории Canonical на GitHub под лицензией GPL-3.0. Несмотря на раннюю стадию разработки (статус «Proposed»), спецификация проекта Myna включает обширный функционал:

  • Push-to-talk: Диктовка активируется удержанием настраиваемой горячей клавиши.
  • Локальный инференс: Распознавание выполняется ресурсами локального железа без обращения к сети.
  • Безопасность аудио: Микрофон включается только по запросу, аудиоданные не сохраняются на накопитель.
  • Индикация: Система уведомляет пользователя о статусах (запись, обработка, финализация, ошибки).
  • Качественная обработка: В приложение попадает только итоговый текст после нормализации, расстановки пунктуации и форматирования (например, запись чисел словами или цифрами).
  • Профили моделей: Пользователь сможет выбирать между легковесными моделями для экономии ресурсов и высокопроизводительными вариантами для лучшего распознавания.
  • Защита ввода: В полях ввода паролей и окнах аутентификации система автоматически блокирует работу диктовки.
  • Интеграция: Для вставки текста текущая реализация использует протоколы IBus с переходом на нативные механизмы Wayland (input-method/text-input).

В первой итерации Canonical сознательно отказывается от таких функций, как постоянное прослушивание, распознавание команд для управления системой или автоматический перевод. Проект Myna преследует прагматичную цель: сделать качественный локальный голосовой ввод доступным инструментом для каждого пользователя Ubuntu.

Источник: https://www.linux.org.ru