Домой Новости ИИ Российский датасет Яндекса ускорил обучение ИИ-рекомендаций в 60 раз

Российский датасет Яндекса ускорил обучение ИИ-рекомендаций в 60 раз

Российский набор данных Yambda позволил исследователям ускорить обучение модели Seater в 60 раз, значительно улучшив качество работы рекомендательных систем.

1
0

Революционный прорыв в обучении рекомендательных систем

Группе ученых из Амстердамского университета удалось достичь впечатляющего результата в области машинного обучения: скорость тренировки рекомендательных систем выросла почти в 60 раз. Ключевым фактором этого достижения стало применение российского набора данных Yambda, который Яндекс открыл для широкого доступа в 2025 году. Об этом официально заявили представители пресс-службы компании.

Графическое представление работы алгоритмов обучения ИИ
Использование датасета Yambda позволило ускорить процесс обучения в 60 раз. Источник: ixbt.com

Сгенерировано нейросетью Grok

Оптимизация модели Seater

В центре внимания исследователей оказалась модель Seater, предназначенная для структурирования контента и товаров в виде иерархических каталогов, напоминающих древовидную систему папок. Такая архитектура обеспечивает высокую точность и скорость подбора рекомендаций, однако процедура подготовки данных до недавнего времени оставалась «узким местом», потребляя до 20% общего времени обучения. Для решения этой задачи ученые разработали два инновационных подхода: один ориентирован на максимально оперативное выполнение, второй сочетает быстрое создание данных с их последующей донастройкой.

Результаты тестирования и преимущества метода

Использование датасета Yambda позволило продемонстрировать эффективность новых алгоритмов на практике:

  • Метод максимальной скорости: позволил сократить время подготовки данных с 82 минут до 83 секунд, при этом качество итоговых рекомендаций осталось на прежнем уровне.
  • Комбинированный подход: обеспечил 15-кратное ускорение процесса и привел к росту точности рекомендаций.

В ходе сравнительных испытаний модель Seater показала превосходство над общепризнанными системами SASRec, BERT4Rec и GRU4Rec, обойдя их по ключевым показателям на 13–17%.

Значение для индустрии ИИ

Разработчики отмечают, что Yambda стал инструментом, доказавшим жизнеспособность генеративных рекомендательных моделей для работы с масштабными каталогами. Весь программный код обновленной модели Seater уже опубликован в открытом доступе, что открывает возможности для внедрения и доработки этих решений в коммерческих продуктах. Напомним, что Yambda представляет собой один из самых объемных публичных датасетов в мире, включающий почти 5 миллиардов обезличенных событий, зафиксированных в сервисе «Яндекс Музыка».

Источник: https://www.ixbt.com