Новое поколение ИИ от Microsoft
Корпорация Microsoft официально представила три инновационные нейросетевые модели собственной разработки: MAI-Transcribe-1, MAI-Voice-1 и MAI-Image-2. Новинки предназначены для работы с речью, озвучиванием текста и генерацией визуального контента. Инструменты уже внедрены в экосистемы Microsoft Foundry и MAI Playground.
Функциональные возможности моделей
- MAI-Transcribe-1: специализированный движок для транскрибации речи. Система демонстрирует рекордно низкий уровень ошибок (WER) в тесте FLEURS для 25 языков, опережая решения OpenAI Whisper-large-v3 и Google Gemini 3.1 Flash. Скорость обработки аудио в форматах MP3, WAV и FLAC выросла в 2,5 раза.
- MAI-Voice-1: модель синтеза текста в речь, генерирующая 60 секунд аудио за одну секунду реального времени. Доступно клонирование голоса по короткому семплу. Стоимость использования оценивается в $22 за 1 млн символов.
- MAI-Image-2: генератор изображений, скорость работы которого выросла вдвое по сравнению с предшественником. Технология уже применяется в Bing и PowerPoint. Тарифы составляют $5 за 1 млн токенов текста и $33 за 1 млн токенов изображений.

Разработка данных моделей стала результатом изменения стратегии сотрудничества с OpenAI, позволяющего Microsoft вести собственные независимые исследования при сохранении партнерства до 2032 года. Над каждой из моделей трудились команды численностью менее 10 человек.
Практическое применение и планы
Решения ориентированы на корпоративный сектор. MAI-Transcribe-1 интегрируется в Microsoft Teams и Copilot, а MAI-Image-2 уже задействована в рекламных проектах WPP. В долгосрочной перспективе компания планирует создание универсальных моделей для конкуренции с ChatGPT, развивая собственную вычислительную инфраструктуру и кластеры для поддержки суперинтеллекта.






