Новый подход к координации ИИ-агентов
В многоагентных системах, где функционирует сразу несколько ИИ-моделей, зачастую возникает конфликт интересов. Каждый агент стремится к максимизации собственной выгоды, что препятствует достижению общей цели, особенно в децентрализованных средах с ограниченным объемом локальных данных.
Метод обучения Predictive Policy Improvement (PPI)
Исследовательская группа Paradigms of Intelligence из Google предложила отказаться от жестко заданных алгоритмов координации. Вместо ручного прописывания правил разработчики применили метод Predictive Policy Improvement (PPI). Агенты обучались в среде, наполненной разнообразными противниками — как статичными моделями, так и другими обучающимися системами. Такой подход заставляет ИИ адаптироваться к поведению окружающих в режиме реального времени, опираясь лишь на историю собственных действий.

Эффективность в теории игр
Для проверки гипотезы использовалась «дилемма заключенного» (Iterated Prisoner’s Dilemma, IPD) — классический сценарий теории игр. Результаты эксперимента показали, что агенты способны достигать стабильной кооперации, не имея доступа к внутренней логике соперников и не используя заранее определенные роли.
Ключевые преимущества подхода:
- Универсальность: Обучение на смешанном наборе стратегий делает агентов устойчивыми к появлению новых типов партнеров.
- Экономия ресурсов: Не требуется увеличение контекстного окна, так как агенты эффективно используют доступные данные.
- Автономия: В отличие от фреймворков типа LangGraph, здесь не нужно вручную прописывать логику переходов.
Использование алгоритмов обучения с подкреплением (например, GRPO) позволяет разработчикам сосредоточиться на создании среды, в которой агенты самостоятельно вырабатывают безопасные и полезные модели поведения. По заявлению авторов, методика масштабируема и эффективна для внедрения в корпоративные многоагентные системы.






