Обновленная версия искусственного интеллекта «ГигаЧат» обзавелась аудиомоделью GigaChat Audio, которая теперь умеет напрямую работать с голосовыми сообщениями и аудиозаписями без предварительного перевода речи в текст. Об этом официально сообщила пресс-служба Сбера.

Нейросеть способна анализировать интонации, определять эмоциональную окраску речи и учитывать её при формировании ответов. Модель поддерживает обработку длительных записей продолжительностью до трех часов, может находить необходимые фрагменты по запросу, создавать емкие краткие пересказы с таймкодами и точно различать участников разговора. Помимо этого, «ГигаЧат» получил функцию запоминания важных сведений из голосового общения для использования в последующих диалогах, причем пользователь сохраняет полный контроль над этой информацией.
Одновременно с этим Сбер предоставил разработчикам доступ к облегченной версии модели GigaChat3.1-Audio-10B, которая поддерживает русский, английский и другие языки. Вместе с ней было опубликовано семейство моделей распознавания речи GigaAM Multilingual, предназначенное для работы с несколькими языками, включая русский, английский, казахский, киргизский и узбекский. Представленные решения отлично подходят для создания продвинутых сервисов транскрибации, современных голосовых ассистентов, систем автоматических субтитров и прочих специализированных речевых приложений.






