Революционный прорыв в обучении рекомендательных систем
Группе ученых из Амстердамского университета удалось достичь впечатляющего результата в области машинного обучения: скорость тренировки рекомендательных систем выросла почти в 60 раз. Ключевым фактором этого достижения стало применение российского набора данных Yambda, который Яндекс открыл для широкого доступа в 2025 году. Об этом официально заявили представители пресс-службы компании.

Сгенерировано нейросетью Grok
Оптимизация модели Seater
В центре внимания исследователей оказалась модель Seater, предназначенная для структурирования контента и товаров в виде иерархических каталогов, напоминающих древовидную систему папок. Такая архитектура обеспечивает высокую точность и скорость подбора рекомендаций, однако процедура подготовки данных до недавнего времени оставалась «узким местом», потребляя до 20% общего времени обучения. Для решения этой задачи ученые разработали два инновационных подхода: один ориентирован на максимально оперативное выполнение, второй сочетает быстрое создание данных с их последующей донастройкой.
Результаты тестирования и преимущества метода
Использование датасета Yambda позволило продемонстрировать эффективность новых алгоритмов на практике:
- Метод максимальной скорости: позволил сократить время подготовки данных с 82 минут до 83 секунд, при этом качество итоговых рекомендаций осталось на прежнем уровне.
- Комбинированный подход: обеспечил 15-кратное ускорение процесса и привел к росту точности рекомендаций.
В ходе сравнительных испытаний модель Seater показала превосходство над общепризнанными системами SASRec, BERT4Rec и GRU4Rec, обойдя их по ключевым показателям на 13–17%.
Значение для индустрии ИИ
Разработчики отмечают, что Yambda стал инструментом, доказавшим жизнеспособность генеративных рекомендательных моделей для работы с масштабными каталогами. Весь программный код обновленной модели Seater уже опубликован в открытом доступе, что открывает возможности для внедрения и доработки этих решений в коммерческих продуктах. Напомним, что Yambda представляет собой один из самых объемных публичных датасетов в мире, включающий почти 5 миллиардов обезличенных событий, зафиксированных в сервисе «Яндекс Музыка».






