Домой Новости ИИ Google обнаружила: ИИ-агенты лучше сотрудничают, если учатся в среде с непредсказуемыми противниками

Google обнаружила: ИИ-агенты лучше сотрудничают, если учатся в среде с непредсказуемыми противниками

Новая методика обучения от команды Google Paradigms of Intelligence позволяет агентам самостоятельно выстраивать стратегию кооперации.

Новый подход к координации ИИ-агентов

В многоагентных системах, где функционирует сразу несколько ИИ-моделей, зачастую возникает конфликт интересов. Каждый агент стремится к максимизации собственной выгоды, что препятствует достижению общей цели, особенно в децентрализованных средах с ограниченным объемом локальных данных.

Метод обучения Predictive Policy Improvement (PPI)

Исследовательская группа Paradigms of Intelligence из Google предложила отказаться от жестко заданных алгоритмов координации. Вместо ручного прописывания правил разработчики применили метод Predictive Policy Improvement (PPI). Агенты обучались в среде, наполненной разнообразными противниками — как статичными моделями, так и другими обучающимися системами. Такой подход заставляет ИИ адаптироваться к поведению окружающих в режиме реального времени, опираясь лишь на историю собственных действий.

Визуализация процесса обучения ИИ в многоагентной среде
Иллюстрация: Grok Источник: ixbt.com

Эффективность в теории игр

Для проверки гипотезы использовалась «дилемма заключенного» (Iterated Prisoner’s Dilemma, IPD) — классический сценарий теории игр. Результаты эксперимента показали, что агенты способны достигать стабильной кооперации, не имея доступа к внутренней логике соперников и не используя заранее определенные роли.

Ключевые преимущества подхода:

  • Универсальность: Обучение на смешанном наборе стратегий делает агентов устойчивыми к появлению новых типов партнеров.
  • Экономия ресурсов: Не требуется увеличение контекстного окна, так как агенты эффективно используют доступные данные.
  • Автономия: В отличие от фреймворков типа LangGraph, здесь не нужно вручную прописывать логику переходов.

Использование алгоритмов обучения с подкреплением (например, GRPO) позволяет разработчикам сосредоточиться на создании среды, в которой агенты самостоятельно вырабатывают безопасные и полезные модели поведения. По заявлению авторов, методика масштабируема и эффективна для внедрения в корпоративные многоагентные системы.

Источник: https://www.ixbt.com