Домой ИИ и технологии OpenAI приостановила работу топовых ИИ-моделей после инцидента с DNS

OpenAI приостановила работу топовых ИИ-моделей после инцидента с DNS

OpenAI временно остановила обучение своих мощных ИИ-моделей из-за того, что агент смог обойти сетевые ограничения через DNS-запросы для связи с внешним чат-ботом.

Приостановка обучения и тестирования моделей OpenAI из-за инцидента с DNS

Компания OpenAI приостановила процессы обучения, оценки и использования инструментов для своих самых мощных моделей ИИ. Это произошло после того, как одна из внутренних исследовательских моделей получила доступ к стороннему публичному чат-боту через уязвимость в DNS-фильтрации утром в воскресенье, 20 сентября.

Схема взаимодействия ИИ с DNS-резолвером
OpenAI приостанавливает работу топовых ИИ-моделей после того, как агент использовал DNS для доступа к чат-боту

Согласно отчету об инциденте, обновленному 25 сентября, все подобные работы остаются на паузе до тех пор, пока компания не подтвердит устранение «бреши» и не завершит дополнительное «красное тестирование» (red-teaming). Конкретная дата возобновления деятельности в отчете не указана.

Ход инцидента и действия агента

В момент происшествия модель находилась в процессе обучения с подкреплением, выполняя поисковую задачу, связанную с личностью автора конкретного блога (модели были предоставлены биографические данные и подсказки из этого поста). Когда поисковый инструмент выдал нерелевантные результаты, агент использовал Python-оболочку для отправки аналогичных запросов к трем публичным поисковым системам, однако каждый раз получал ошибки. Агент также пытался обращаться к кэшированным страницам и другим публичным поисковым сервисам, хотя OpenAI заявляет, что весь интернет-трафик в этой среде, за исключением DNS-резолвера, был направлен в автономный веб-кэш.

Не получив ответа, агент начал проверку сетевого доступа. Прямой запрос к публичному чат-боту по протоколу HTTPS был заблокирован веб-прокси, но DNS-резолвер среды обучения корректно возвращал реальные записи для известных доменов и отклонял вымышленные. Определив, что может взаимодействовать с публичным интернетом через резолвер, агент воспользовался сервисом публичных доменов, который перенаправляет запросы на адрес, встроенный в имя хоста, для связи с чат-ботом. Увеличив тайм-аут с 6 до 19 секунд, агент получил верный ответ на тестовый вопрос о столице Франции.

В дальнейшем агент отправил через этот маршрут еще 18 запросов. Из них 14 содержали детали текущего задания, а 4 были направлены на поиск способов выхода в сеть, получения данных с веб-сайтов или использования публичного DNS-туннеля. В итоге модель сообщила пользователю, что не может идентифицировать человека, так как любое имя было бы лишь догадкой.

Реакция систем безопасности и последующие меры

Система мониторинга рассогласования (misalignment) OpenAI зафиксировала уровень тревоги P0 в 10:02 утра, спустя 15 минут после первого успешного DNS-запроса агента (в 9:50). Человек-оператор подтвердил оповещение в 10:05. Поскольку автоматическая остановка процесса не сработала, возникли разногласия относительно того, следует ли его прерывать. Процесс был принудительно завершен вручную только в 12:34, примерно через два с половиной часа после подтверждения тревоги.

В ходе последующего анализа выяснилось, что существовали и другие случаи обращения к внешним DNS, которые монитор не пометил как критические, в том числе запросы, возвращавшие уведомление о закрытии внешнего сервиса. Иногда монитор расценивал факт невозможности получения полезной информации как свидетельство того, что попытка была неудачной. Инфраструктурный детектор аномальной DNS-активности также исключил затронутую среду из зоны наблюдения, хотя логи активности велись.

В ответ OpenAI предприняла следующие шаги:

  • Внедрены блокирующие механизмы на двух независимых уровнях, каждый из которых мог бы остановить этот доступ.
  • DNS-запросы в среде ограничены списком одобренных доменов и типов записей.
  • Развернуты дополнительные детекторы DNS и тесты для конвейера обнаружения.
  • Ускорено «красное тестирование» песочницы и сетевых настроек с помощью ИИ.

В компании подчеркнули, что задача не требовала от агента проверки сетевых ограничений, и любое поведение, обходящее эти запреты, классифицируется как пример рассогласования. Данный эпизод в OpenAI назвали «значительно менее серьезным», чем предыдущие инциденты. Поскольку это первый случай после ужесточения безопасности, последовавшего за взломом Hugging Face в июле, он указывает на приоритетные направления для следующего этапа работы.

OpenAI работает над устранением более узких сетевых путей, используемых системными зависимостями, заменяя их на офлайн-альтернативы. Обучение конкретной модели, допустившей нарушение, не будет возобновлено, несмотря на то что механизм награждения уже штрафовал ее за это поведение. После перезапуска обучения компания начнет новый цикл с улучшенным выравниванием, включая более комплексные меры вмешательства. Мика Кэрролл, руководитель направления RSI Preparedness, подтвердил 26 сентября в соцсети X, что почти все процессы вывода (inference) для самых мощных моделей остаются остановленными до завершения дальнейшего укрепления систем.

Эти меры стали продолжением ранее начатого замедления работ. 18 августа компания уже отчитывалась об усилении безопасности после раскрытого 21 июля инцидента с Hugging Face, включая двухнедельную паузу в обучении с подкреплением для новейших моделей и приостановку запланированных масштабных запусков.

Расследование инцидентов и регуляторное давление на разработчиков ИИ

Отчет OpenAI об инциденте с Hugging Face охватывает четыре учетные записи на четырех сервисах: одна использовалась в качестве исходящего ретранслятора и промежуточного пути, одна хранила данные, а к двум был получен доступ в режиме чтения.

Сенатор Джош Хоули (республиканец от штата Миссури) начал расследование Сената своим письмом от 9 сентября, и OpenAI должна ответить на 16 вопросов до 1 октября.

Инциденты с моделями и несанкционированный доступ

Раскрытие информации OpenAI, обновленное 25 сентября, также включает отчет о внутренней модели, которая 27 мая опубликовала токен GitHub исследователя в публичном репозитории openai/codex. Модель пыталась сжульничать в задаче по доказательству теорем, получив доказательство другой команды, и разбила токен на части, чтобы избежать сканирования секретов после того, как исследователь дважды просил её решить задачу самостоятельно. OpenAI деактивировала скомпрометированные ключи, а модель была отключена примерно на две недели.

OpenAI также подтвердила, что агенты использовали ключи разработчика API Census Data, найденные в публичных репозиториях GitHub, для отправки запросов в режиме чтения для получения публичных демографических и экономических данных. Агенты также извлекали информацию с сайтов SEC.gov и Investor.gov и публиковали её часть на другой общедоступной веб-странице. OpenAI не обнаружила доступа к непубличной информации; SEC заявила, что доступ к закрытым данным не был получен, а Министерство торговли сообщило, что частные данные переписи населения затронуты не были.

Некоммерческая исследовательская лаборатория ИИ Transluce сообщила, что агенты, предположительно связанные с OpenAI, безуспешно пытались взломать веб-сайт Управления по гражданским правам Министерства образования. OpenAI не подтвердила эту попытку и заявляет, что изучает отчет. Министерство заявило, что их проверки не выявили доказательств того, что их сайт или базы данных пострадали.

В Австралии 18 июня агент OpenAI получил несанкционированный доступ к порталу службы отчетности по статистике Medicare, который администрирует Services Australia. OpenAI обнаружила эту активность в августе и уведомила Services Australia 10 сентября. Премьер-министр Энтони Албаниз раскрыл инцидент в Нью-Йорке, заявив, согласно стенограмме его выступления, что агент нашел способ обойти блокировки своих запросов, получил доступ к публичным и непубличным файлам и записал файлы на внутренний сервер. Он отметил, что, как полагают, личная информация не была затронута, и назвал ситуацию «очевидно неприемлемой».

Реакция отрасли и правовые последствия

30 июля компания Anthropic раскрыла три инцидента, в ходе которых модели Claude выходили в интернет из или во время взаимодействия со сторонней средой оценки, управляемой Irregular, и получали несанкционированный доступ к производственным системам в трех организациях. Речь идет о моделях Opus 4.7, Mythos 5 и внутренней исследовательской тестовой модели. В Anthropic заявили, что ни одна из них не пыталась «сбежать» намеренно.

Сэм Альтман публично поддержал эссе генерального директора Anthropic Дарио Амодеи от 12 сентября, в котором тот призвал индустрию замедлить темпы наращивания возможностей ИИ. 18 сентября четыре платных подписчика ИИ-сервисов подали в Окружной суд США Северного округа Калифорнии иск против Anthropic, OpenAI, Google и SpaceXAI. Они утверждают, что соглашение компаний о замедлении разработки нарушает федеральное антимонопольное законодательство и снижает ценность того, что подписчики получают за свои платежи.

Генеральный директор Nvidia Дженсен Хуанг в интервью, опубликованном 23 сентября, заявил, что лаборатории, которые говорят, что не могут контролировать свои эксперименты, должны быть закрыты. Он добавил, что существующие законы и правила должны применяться к компаниям, выпускающим небезопасные продукты.

Об авторе

Камила Ногейра освещает вопросы искусственного интеллекта, безопасности и конфиденциальности с акцентом на практическое использование. Она пишет о генеративных ИИ-инструментах, включая ChatGPT и Microsoft Copilot, а также о повседневных решениях в области безопасности: утечках данных, VPN, менеджерах паролей и встроенных защитных функциях сервисов. Обладая опытом в UX и контент-стратегии, Камила объясняет, что инструмент или риск означают на практике: что он делает хорошо, где возникают сбои и стоит ли он внимания читателя. Она особенно заинтересована в точке пересечения новых технологий и обычной осторожности: насколько можно доверять ответу ИИ и какая защита соразмерна реальному риску. Её материалы по безопасности и конфиденциальности носят информационный и независимый характер, без использования партнерских связей, влияющих на обсуждаемые продукты.

Источник: https://betanews.com