Современные большие языковые модели (LLM) ограничены своей «текстовой» природой: они не приспособлены для управления робототехникой или беспилотным транспортом, так как им не хватает понимания физики реального мира. Чтобы преодолеть этот барьер, ведущие исследователи, включая Фей-Фей Ли и Яна Лекуна, сосредоточились на разработке так называемых «мировых моделей» (world models). В отличие от LLM, такие системы требуют обучения на сочетании визуальных данных и информации о совершаемых действиях.

Данные из видеоигр как способ обучения ИИ
Главная проблема текущих исследований заключается в отсутствии подходящих массивов данных, содержащих причинно-следственные связи. Профессор Сяотянь Чжу из Университета Суррея отмечает, что в интернете крайне мало контента, который демонстрировал бы физическое взаимодействие объектов с необходимой точностью. Британский стартап Worldmodeldata, консультируемый Яном Лекуном, намерен решить эту задачу, собирая и систематизируя данные об игровых сессиях.
Генеральный директор компании Рея Лукас считает видеоигры идеальным источником для обучения нейросетей, поскольку они представляют собой огромные, разнообразные и постоянно растущие виртуальные среды. Worldmodeldata планирует выступать в роли брокера, который избавляет исследовательские лаборатории от необходимости заключать индивидуальные соглашения с десятками студий. На данный момент стартап уже лицензировал около миллиона часов игровых данных, а в будущем рассматривает возможность компенсации для обычных геймеров, чей игровой опыт помогает совершенствовать алгоритмы.
Почему количество и разнообразие данных критичны
Согласно гипотезе разработчиков, производительность мировых моделей будет напрямую зависеть от объема обучающих выборок, подобно тому как это происходит с языковыми моделями. Попытки собирать данные вручную — например, через установку датчиков на людей или роботов — признаны недостаточно эффективными, так как они не покрывают «граничные случаи» (corner cases), которые критически важны для безопасной работы автономных систем в реальных условиях. Николь Френкель из венчурной фирмы Khosla Ventures подчеркивает, что цена ошибки в таких сферах, как управление автомобилем, дроном или промышленным погрузчиком, слишком велика, поэтому разнообразие игровых ситуаций позволяет модели лучше подготовиться к непредсказуемости окружающего мира.
Скептицизм экспертов относительно точности физики
Несмотря на потенциал, не все специалисты разделяют оптимизм относительно использования игровых данных. Мин-Ю Лю, руководитель направления разработки мировых моделей в Nvidia, указывает на то, что видеоигровая физика часто является приближенной и «эксцентричной». Разработчики игр используют упрощения для создания визуальной иллюзии, игнорируя такие детали, как точная сила нажатия пальцев при захвате объекта, которая необходима для реальных манипуляций.
По мнению представителя Nvidia, использование данных из игр оправдано для генерации гиперреалистичного видео, но недостаточно надежно для обучения точным моторным навыкам. Сяотянь Чжу также отмечает, что, хотя игры обладают определенной физической основой, они остаются лишь грубой симуляцией. Тем не менее на данном этапе индустрия находится в поиске наиболее эффективных подходов к созданию «ChatGPT-момента» для мировых моделей, и разные методы, включая использование игровых данных, продолжают тестироваться параллельно.
Проблема «остроты» физических взаимодействий
Для создания полноценных мировых моделей разработчикам недостаточно просто «видеть» картинку. Как отмечают эксперты, перед тем как робот сможет уверенно управлять манипулятором, модель должна быть обучена не только видеоматериалами с производственных площадок, но и конкретными параметрами физического взаимодействия. Сюда входят данные о том, с какой силой объект должен быть захвачен, какой крутящий момент прикладывается при его перемещении и другие критически важные показатели. Проблема текущих интернет-архивов, на которых обучаются современные нейросети, заключается именно в отсутствии этих «причинно-следственных» пластов информации, которые критически важны для систем, действующих в физическом пространстве.
Видеоигры как кладезь «граничных случаев»
Николь Френкель из Khosla Ventures указывает на ключевое различие между ручным сбором данных и использованием игровых активов. Традиционные методы, такие как запись действий человека в тестовых лабораториях, дают ограниченный объем информации и не способны отразить хаос реального мира. Повторение одних и тех же движений «выбери и положи» (pick-and-place) не учит машину справляться с беспорядком, непредсказуемыми препятствиями или редкими сценариями. Именно «граничные случаи» (corner cases) представляют наибольшую опасность: ошибка алгоритма при управлении беспилотным автомобилем, дроном или промышленным погрузчиком может обернуться катастрофой. Видеоигры, в свою очередь, предоставляют невероятно разнообразные сценарии, которые позволяют подготовить ИИ к экстремальным и нестандартным ситуациям, с которыми он может столкнуться в «дикой природе».
Конкурирующие подходы и будущее архитектур
Индустрия мировых моделей сейчас находится в стадии активного поиска оптимальной методики. Несмотря на активность Worldmodeldata, существуют альтернативные точки зрения. Nvidia, например, делает ставку на собственные проприетарные движки, разработанные специально для максимально точного воспроизведения физических законов. Мин-Ю Лю из Nvidia аргументирует это тем, что в игровых движках разработчики часто применяют «короткие пути» для создания визуального реализма. Например, персонаж может красиво взять яблоко со стола, но на программном уровне игра не просчитывает давление каждого пальца, необходимое для удержания предмета от выскальзывания. Именно поэтому в Nvidia полагают, что данные из игр стоит использовать преимущественно для генерации гиперреалистичной графики или 3D-сред, а не для обучения тонкой моторике робототехники.
Тем не менее, основательница Worldmodeldata Рея Лукас уверена в правильности выбранного пути. Она полагает, что в конечном итоге видеоигровые данные составят основу мировых моделей, которые впоследствии будут «дообучаться» под специфические узкие задачи в реальном мире. По её мнению, это может стать тем самым «GPT-моментом», который выведет развитие ИИ на принципиально новый уровень полезности. В индустрии продолжают существовать разные подходы, и на текущий момент, как отмечает Николь Френкель, окончательного ответа на вопрос о том, какая именно стратегия приведет к созданию «идеального разума», пока не существует — в этой гонке верны все пути, ведущие к обещанному технологическому прорыву.






