Домой Новости ИИ «ГигаЧат» Сбера научился распознавать эмоции и анализировать длинные аудиозаписи

«ГигаЧат» Сбера научился распознавать эмоции и анализировать длинные аудиозаписи

Новая аудиомодель GigaChat Audio обрабатывает длинные записи до трех часов, понимает интонации и запоминает детали разговоров.

Обновленная версия искусственного интеллекта «ГигаЧат» обзавелась аудиомоделью GigaChat Audio, которая теперь умеет напрямую работать с голосовыми сообщениями и аудиозаписями без предварительного перевода речи в текст. Об этом официально сообщила пресс-служба Сбера.

Интерфейс и концепт работы аудиомодели ГигаЧат со звуковыми данными
Изображение сгенерировано нейросетью ChatGPT Источник: ixbt.com

Нейросеть способна анализировать интонации, определять эмоциональную окраску речи и учитывать её при формировании ответов. Модель поддерживает обработку длительных записей продолжительностью до трех часов, может находить необходимые фрагменты по запросу, создавать емкие краткие пересказы с таймкодами и точно различать участников разговора. Помимо этого, «ГигаЧат» получил функцию запоминания важных сведений из голосового общения для использования в последующих диалогах, причем пользователь сохраняет полный контроль над этой информацией.

Одновременно с этим Сбер предоставил разработчикам доступ к облегченной версии модели GigaChat3.1-Audio-10B, которая поддерживает русский, английский и другие языки. Вместе с ней было опубликовано семейство моделей распознавания речи GigaAM Multilingual, предназначенное для работы с несколькими языками, включая русский, английский, казахский, киргизский и узбекский. Представленные решения отлично подходят для создания продвинутых сервисов транскрибации, современных голосовых ассистентов, систем автоматических субтитров и прочих специализированных речевых приложений.

Источник: https://www.ixbt.com