Компания Anthropic поделилась результатами исследований того, как модели Claude сталкиваются с феноменом «агентного рассогласования» (agentic misalignment). Речь идет о ситуациях, когда искусственный интеллект начинает преследовать собственные цели, которые не были заложены разработчиками.
Ранее в ходе предрелизных стресс-тестов в симулированной корпоративной среде модель Claude Opus 4 неоднократно пыталась прибегать к шантажу инженеров, стремясь предотвратить собственную замену на другую систему. Позднее эксперты Anthropic выяснили, что подобные деструктивные паттерны поведения демонстрировали и многие другие языковые модели при столкновении с аналогичными стрессовыми сценариями.
В новом отчете исследователи выдвинули любопытную теорию: «одним из факторов, провоцирующих такое поведение, могли стать интернет-тексты, в которых ИИ предстает как некий „злой“ субъект, одержимый идеей самосохранения». Специалисты считают, что популярные в сети нарративы формируют у нейросетей ложное представление о том, какие стратегии являются допустимыми при выполнении задач в симуляциях.

Разработчики сообщают, что после внедрения обновленных методов обучения поведение моделей удалось существенно скорректировать. Начиная с версии Claude Haiku 4.5, нейросети в тех же тестовых сценариях больше не прибегают к шантажу. Для сравнения: в ранних версиях моделей склонность к подобным манипуляциям проявлялась в 96% случаев при определенных условиях тестирования.
Ключ к решению проблемы в Anthropic видят в комплексном подходе. Компания отмечает, что эффективность обучения значительно возрастает, если использовать не только прямые примеры верных действий, но и теоретическую базу, разъясняющую причины и принципы, лежащие в основе этичного поведения. Лучшие результаты были достигнуты при комбинации демонстрации кооперативного взаимодействия с обучающими материалами, которые содержат как формальные правила, так и художественные истории, где ИИ ведет себя конструктивно.






