Сбер представил обновленную версию нейросетевой модели GigaChat Audio, ключевой особенностью которой стала возможность прямой работы с аудиозаписями и голосовыми сообщениями без необходимости предварительного транскрибирования в текстовый формат. Система анализирует тембр, интонацию и особенности произношения, что позволяет ей точно определять эмоциональный окрас речи.
Модель оптимизирована для обработки длинных аудиофайлов — она способна анализировать записи продолжительностью до трех часов. Функционал включает в себя поиск конкретных фрагментов внутри записи, автоматическое создание резюме с расстановкой таймкодов, ответы на уточняющие вопросы по содержанию и способность идентифицировать разных участников диалога.
_large.jpg)
Важным нововведением стала поддержка долговременной памяти. GigaChat Audio сохраняет факты, упомянутые в голосовых беседах, и опирается на них в последующих диалогах. Разработчики предусмотрели инструменты управления: в настройках можно в любой момент просмотреть список запомненных данных, отредактировать их или полностью деактивировать функцию накопления опыта.
Согласно внутренним тестам Сбера, модель демонстрирует производительность на уровне ведущих мировых аналогов. В ходе испытаний Arena Hard Audio, где нейросети сравниваются в «слепом» тестировании при ответе на голосовые запросы, GigaChat Audio одержал победу в 75% случаев. Для сравнения, показатель Gemini-3-Flash-preview составляет 77,5%, а Gemini 2.5 Pro — 62%. Кроме того, точность распознавания эмоций у новой модели достигла 80%, что превышает результаты Qwen3-Omni-30B (70%) и Kimi-Audio (62%).






