
Компания Canonical анонсировала проект Myna — новую систему для преобразования речи в текст, предназначенную для использования в Ubuntu Desktop. Ключевая концепция разработки заключается в реализации функции встроенной диктовки: пользователь задействует горячую клавишу, надиктовывает текст, и тот мгновенно появляется в активном окне приложения. Разработчики делают упор на то, чтобы инструмент ощущался как неотъемлемая часть операционной системы, при этом строго придерживаясь принципов конфиденциальности.
Первые шаги: ориентир на Ubuntu 26.10
В текущих планах Canonical не значится создание полноценного голосового ассистента или системы управления интерфейсом с помощью команд. Вместо этого команда сфокусировалась на создании базового, надежного инструмента для диктовки. Целевой платформой для первой версии выбрана Ubuntu Desktop на базе Wayland с графическим окружением GNOME, однако архитектура системы закладывается как открытая для последующей интеграции с другими средами рабочего стола.
Приватность и локальная обработка
Главная особенность Myna заключается в полностью локальном распознавании речи. После загрузки необходимых моделей работа функции не требует интернет-соединения. Обработка аудиопотока происходит непосредственно в оперативной памяти устройства, а после завершения транскрибации данные удаляются — отправка записей на сторонние облачные серверы исключена. Проектная спецификация прямо запрещает использование облачных сервисов по умолчанию.
Технические возможности и функции
Исходный код проекта и сопутствующая документация уже доступны в репозитории Canonical на GitHub под лицензией GPL-3.0. Несмотря на раннюю стадию разработки (статус «Proposed»), спецификация проекта Myna включает обширный функционал:
- Push-to-talk: Диктовка активируется удержанием настраиваемой горячей клавиши.
- Локальный инференс: Распознавание выполняется ресурсами локального железа без обращения к сети.
- Безопасность аудио: Микрофон включается только по запросу, аудиоданные не сохраняются на накопитель.
- Индикация: Система уведомляет пользователя о статусах (запись, обработка, финализация, ошибки).
- Качественная обработка: В приложение попадает только итоговый текст после нормализации, расстановки пунктуации и форматирования (например, запись чисел словами или цифрами).
- Профили моделей: Пользователь сможет выбирать между легковесными моделями для экономии ресурсов и высокопроизводительными вариантами для лучшего распознавания.
- Защита ввода: В полях ввода паролей и окнах аутентификации система автоматически блокирует работу диктовки.
- Интеграция: Для вставки текста текущая реализация использует протоколы IBus с переходом на нативные механизмы Wayland (input-method/text-input).
В первой итерации Canonical сознательно отказывается от таких функций, как постоянное прослушивание, распознавание команд для управления системой или автоматический перевод. Проект Myna преследует прагматичную цель: сделать качественный локальный голосовой ввод доступным инструментом для каждого пользователя Ubuntu.






