Лаборатория Xiaomi AI Labs представила OmniVoice — инновационную систему синтеза речи и клонирования голоса, поддерживающую 646 языков. Для создания цифровой копии достаточно небольшого аудиофрагмента, после чего нейросеть способна воспроизводить речь этим голосом на любом из поддерживаемых языков. Важно, что проект полностью открыт: Xiaomi опубликовала исходный код, веса модели и использованные обучающие данные.
Технологические особенности OmniVoice
В основе OmniVoice лежит оптимизированная архитектура, обеспечивающая высокую скорость генерации: процесс происходит в 40 раз быстрее реального времени без применения дополнительной оптимизации. Инженеры применили предварительно обученные параметры больших языковых моделей (LLM), что позволило существенно повысить естественность звучания.
_large.jpg)
Для обучения системы был использован массив данных объёмом 580 000 часов, состоящий из 50 открытых наборов. Все аудиоматериалы прошли предварительную фильтрацию и процедуру шумоподавления. Результаты внутренних тестов показали, что OmniVoice превосходит многие существующие коммерческие аналоги по уровню разборчивости и естественности речи на 24 языках, а при тестировании на 102 языках качество генерации практически не отличимо от реальных человеческих записей.
Расширенные возможности синтеза
Помимо прямого клонирования голоса, модель обладает рядом дополнительных функций:
- Настройка характеристик голоса с помощью текстового описания.
- Автоматическая очистка аудио от фоновых шумов.
- Внедрение эмоциональных маркеров, таких как смех или вздохи.
- Корректировка произношения имен собственных и сложных лингвистических конструкций.
Появление подобных решений, наряду с развитием инструментов вроде Китайский ИИ ценой втрое ниже топовых конкурентов, значительно снижает порог входа для разработчиков, желающих внедрить продвинутые речевые технологии в свои продукты.






