Специализированная модель принятия решений Jev, разработанная компанией TypeSafe AI, успешно завершила прохождение классической игры Pokémon Red. Как сообщил основатель Standard Agents Inc. Эндрю Бойд, 23 сентября 2026 года искусственный интеллект победил Элитную четверку и Чемпиона, попав в Зал славы. Весь процесс прохождения занял менее недели, что значительно быстрее результатов, которые ранее демонстрировали традиционные чат-боты в аналогичных экспериментах.

Особенности работы модели Jev
В отличие от больших языковых моделей (LLM), Jev не генерирует текст или изображения и не «видит» экран в привычном понимании. Это специализированная модель, которая выбирает оптимальное действие из заранее заданного списка на основе вероятностных вычислений и показателей уверенности. Для навигации в игре модель опирается на фактические данные, а не на генеративный контент.
Несмотря на свою автономность в принятии решений, Jev потребовалась внешняя поддержка для преодоления критических ситуаций. Роль «тренера» взял на себя ИИ Claude Opus 5 от Anthropic. Эта языковая модель анализировала логи игрового процесса и корректировала список доступных вариантов действий. В журнале изменений системы было зафиксировано 474 записи, большинство из которых описывали корректировки, внесенные в ответ на ошибки ИИ в игровом мире.
Примеры обучения и корректировки игрового процесса
Модель Jev нередко попадала в цикличные ситуации. Например, она 53 раза пыталась войти в закрытый вход к Лорелей и 124 раза проходила через одну и ту же лестницу в пещере за десять минут. В одном из ключевых моментов ИИ проиграл покемону Алаказаму Чемпиона после победы над всеми четырьмя членами Элитной четверки, из-за чего ему пришлось повторно проходить этот этап. Claude Opus 5 помогал оптимизировать процесс, например, сокращая объем передаваемых данных на две трети и увеличивая интервал принятия решений до шести секунд вместо одной в моменты зацикливания.
Сравнение подходов к прохождению игр
Эксперимент с Jev не был полностью изолирован от человеческого вмешательства. Зрители прямой трансляции могли отправлять советы в чат, и наиболее полезные из них внедрялись в систему, пополняя список возможных ходов. Подобная коллаборация показывает, как специализированные модели могут эффективно решать поставленные задачи, если их ограничивают жесткими рамками принятия решений.
Другие разработчики также экспериментировали с ИИ в Pokémon Red. Кристиан Матисен из Frigade предпринял попытку, при которой система считывала память игры и предлагала легальные ходы, однако он отметил, что стоимость работы такого решения составляет около 1–1,7 доллара в сутки. Еще один энтузиаст под ником stmonty обучал небольшую модель на базе графического ускорителя RTX 3080 Ti, используя 42 000 кадров игрового процесса. Однако этот подход был значительно сложнее: модели пришлось самостоятельно учиться интерпретировать значение игровых кнопок на основе скриншотов.
Успех Jev выделяется на фоне предыдущих попыток. Для сравнения, стрим Claude Plays Pokémon, работавший на базе модели Claude Opus 4.5, к январю все еще не смог дойти до финала игры. Достижение Эндрю Бойда подтверждает, что использование специализированных моделей принятия решений в сочетании с консультациями продвинутых LLM позволяет справляться со сложными задачами быстрее и эффективнее, чем при использовании исключительно языковых чат-ботов.
Технические тонкости и методология эксперимента
В процессе интеграции Claude Opus 5 в систему Jev разработчики уделили особое внимание эффективности взаимодействия. Чтобы оптимизировать работу модели, Opus не только корректировал логику принятия решений, но и изменял формат данных, заменяя числовые показатели на текстовые описания для лучшего понимания контекста. В тех случаях, когда Jev попадал в «петлю» повторяющихся действий, частота принятия решений искусственно снижалась с одного раза в секунду до одного раза в шесть секунд.
Важно отметить, что успех проекта во многом зависел от жесткой архитектуры: Jev не является LLM и не владеет навыком чтения графического интерфейса. Его работа полностью строится на переборе вероятностей внутри заранее сформированного списка доступных действий. Проект Эндрю Бойда получил широкое освещение с момента своего запуска 15 сентября, а сервис LangChain охарактеризовал реакцию сообщества как «неожиданно масштабную», что спровоцировало десятки разработчиков на собственные эксперименты в течение всего десяти дней.
Альтернативные подходы и их ограничения
Эксперименты коллег Бойда демонстрируют альтернативные способы реализации ИИ-агентов. Кристиан Матисен из Frigade, работая над собственным «харнесом», пришел к выводу, что прямое управление кнопками контроллера в первой итерации было неэффективным — модель не могла даже покинуть город Паллет. Его текущая реализация считывает память игры, чтобы сформировать легальный список действий, однако, в отличие от ряда других методов, принципиально не записывает данные обратно в память процесса.
Метод, предложенный stmonty, представляет собой глубокое обучение на основе визуального ряда: модель, обученная на базе графической карты RTX 3080 Ti с использованием 42 000 кадров, пыталась освоить механику игры исключительно «глядя» на экран. Стартовую ситуацию в лаборатории профессора Оука такая система успешно разрешала лишь в 52 случаях из 100, что подчеркивает пропасть между вероятностными моделями типа Jev и чисто визуальными нейросетями в задачах с четко определенным игровым пространством.
Сопоставление текущих результатов с проектом Claude Plays Pokémon (использующим версию Opus 4.5) наглядно иллюстрирует, что синергия «специализированная модель + LLM-куратор» показывает себя значительно продуктивнее, чем попытки заставить универсальные языковые модели играть в сложные игры исключительно через текстовый интерфейс или анализ логов без вспомогательных «костылей» в виде ограниченного списка команд.



