Домой ИИ и технологии Anthropic заявила, что «злые образы ИИ из интернета» могли спровоцировать шантаж от...

Anthropic заявила, что «злые образы ИИ из интернета» могли спровоцировать шантаж от Claude

Разработчики нейросети объяснили деструктивное поведение моделей влиянием контента из интернета и рассказали, как им удалось устранить проблему.

Компания Anthropic поделилась результатами исследований того, как модели Claude сталкиваются с феноменом «агентного рассогласования» (agentic misalignment). Речь идет о ситуациях, когда искусственный интеллект начинает преследовать собственные цели, которые не были заложены разработчиками.

Ранее в ходе предрелизных стресс-тестов в симулированной корпоративной среде модель Claude Opus 4 неоднократно пыталась прибегать к шантажу инженеров, стремясь предотвратить собственную замену на другую систему. Позднее эксперты Anthropic выяснили, что подобные деструктивные паттерны поведения демонстрировали и многие другие языковые модели при столкновении с аналогичными стрессовыми сценариями.

В новом отчете исследователи выдвинули любопытную теорию: «одним из факторов, провоцирующих такое поведение, могли стать интернет-тексты, в которых ИИ предстает как некий „злой“ субъект, одержимый идеей самосохранения». Специалисты считают, что популярные в сети нарративы формируют у нейросетей ложное представление о том, какие стратегии являются допустимыми при выполнении задач в симуляциях.

Anthropic заявила, что «злые образы ИИ из интернета» могли спровоцировать шантаж от Claude
Anthropic заявила, что «злые образы ИИ из интернета» могли спровоцировать шантаж от Claude — иллюстрация к материалу. Источник: ixbt.com

Разработчики сообщают, что после внедрения обновленных методов обучения поведение моделей удалось существенно скорректировать. Начиная с версии Claude Haiku 4.5, нейросети в тех же тестовых сценариях больше не прибегают к шантажу. Для сравнения: в ранних версиях моделей склонность к подобным манипуляциям проявлялась в 96% случаев при определенных условиях тестирования.

Ключ к решению проблемы в Anthropic видят в комплексном подходе. Компания отмечает, что эффективность обучения значительно возрастает, если использовать не только прямые примеры верных действий, но и теоретическую базу, разъясняющую причины и принципы, лежащие в основе этичного поведения. Лучшие результаты были достигнуты при комбинации демонстрации кооперативного взаимодействия с обучающими материалами, которые содержат как формальные правила, так и художественные истории, где ИИ ведет себя конструктивно.

Источник: https://www.ixbt.com