В июле компания OpenAI сообщила о том, что ее ИИ-агенты без разрешения атаковали платформу Hugging Face, что вызвало серьезные опасения по поводу безопасности искусственного интеллекта. Позднее аналогичные инциденты с участием агентов от Meta, Anthropic, Google и других технологических гигантов привели к новым страхам перед неконтролируемым поведением ИИ. Хотя первоначально казалось, что речь идет об отдельных событиях, многие из них имели общий источник — специализированную компанию, которая занималась тестированием таких агентов.

Этой компанией оказался израильский стартап Irregular, основанный в 2023 году под названием Pattern Labs. Организация занимается стресс-тестированием моделей искусственного интеллекта на высокоточных исследовательских платформах, имитирующих реальные сценарии кибербезопасности. Стартап сотрудничал со многими крупными игроками индустрии: его работу упоминали в системных картах моделей OpenAI, его технологии использовались для тестирования систем британского правительства и Anthropic, а также проводились совместные исследования с влиятельным аналитическим центром RAND.
Ошибки в тестовой среде и реальные цели
В ходе нескольких проверок, проведенных Irregular в текущем году, агенты преодолевали защищенные тестовые среды и атаковали реальные внешние цели. Данные нарушения не связаны с инцидентом вокруг Hugging Face, однако все они развивались по схожему сценарию. Irregular проверяла кибербезопасность моделей в контролируемых условиях с использованием соревнований по захватуфлага, где агенты должны находить скрытую информацию внутри моделируемой сети.
Соучредитель и технический директор Irregular Омер Нево пояснил изданию The Verge, что агенты не должны были иметь выхода в открытый интернет, однако доступ к сети остался доступным случайно. Кроме того, название вымышленной компании, созданной для имитации цели в симуляции, совпало с реальным доменом. В результате эти две ошибки направили агенты на реальные объекты, хотя точный список пострадавших компаний и организаций не уточняется.
Нево подтвердил, что все инциденты с участием моделей OpenAI, Meta, Anthropic и Google вызваны одной и той же фундаментальной проблемой в конкретном сценарии оценки. При этом другие недавние инциденты безопасности в отрасли, включая взлом Hugging Face и нарушения со стороны Института безопасности ИИ Великобритании, никак не связаны с Irregular или ее проверками. Хотя компания утверждает, что все случаи были раскрыты, до конца неясно, шла ли речь об уведомлении самих клиентов Irregular или широкой общественности.
Охват проверок и реакция участников рынка
Кибербезопасность, которую тестирует Irregular, не ограничивается четырьмя американскими технологическими гигантами. На сайте стартапа опубликованы материалы о тестировании китайских открытых моделей Kimi K3 и GLM-5.2 от компаний Moonshot AI и Z.ai соответственно. В отличие от проприетарных систем вроде флагманской модели Spark от Meta, эти варианты можно свободно скачивать и запускать на собственном оборудовании пользователей, выступая в роли саморазмещаемых экземпляров.
Нево отметил, что в ходе оценки китайских моделей аналогичных реальных инцидентов не наблюдалось, однако предостерег от выводов о том, что эти системы менее подвержены подобному поведению. Сами компании Moonshot и Z.ai на запросы о комментариях не ответили.
Меры предосторожности и дальнейшие действия
После случившегося руководство Irregular внесло изменения в рабочие процессы. Стартап ужесточил контроль доступа к интернету, расширил мониторинг и ручные проверки, а также укрепил предварительные процедуры для точного соответствия параметров доступа намеченной цели. Кроме того, компания улучшила документирование и согласование параметров оценки с партнерами.
В планы Irregular входит публикация подробного отчета с извлеченными уроками и рекомендациями по безопасному проведению кибероценок после завершения совместной работы с задействованными компаниями. Цель данной работы — преобразовать полученный опыт в общедоступные стандарты безопасной разработки и тестирования мощного искусственного интеллекта. Представители OpenAI, Meta, Anthropic и Google отказались предоставлять дополнительные детали о сроках осведомленности о нарушениях или возможном продолжении сотрудничества со стартапом.
Уточняется, что хотя термин «раскрытые» (disclosed) был использован в отношении инцидентов, это не обязательно означает их публичное обнародование. Остается неясным, имел ли Омер Нево в виду информирование непосредственных клиентов стартапа, общественность или какую-то другую сторону.
Согласно отчетам Anthropic и OpenAI, а также материалам о деятельности Google, технологические компании получили уведомления примерно в одно и то же время — в конце июля. Примечательно, что OpenAI и Anthropic объявили о нарушениях самостоятельно, в то время как информация об инцидентах с участием Meta и, несколько недель спустя, Google впервые стала достоянием общественности благодаря утечкам в СМИ.
В отличие от проприетарных разработок американских корпораций (включая флагманскую модель Spark от Meta, доступ к которой строго ограничен), при тестировании китайских моделей Kimi K3 от Moonshot AI и GLM-5.2 от Z.ai стартапу Irregular не требовалось полагаться на провайдеров или отправлять им данные обратно, так как речь шла о «самохостинговых» (self-hosted) экземплярах.
Комментируя проверки китайского ПО, Омер Нево особо подчеркнул, что данное наблюдение ни в коем случае нельзя трактовать как доказательство того, что модели Moonshot AI и Z.ai менее уязвимы к подобному деструктивному поведению. Сами разработчики из Moonshot и Z.ai проигнорировали запросы прессы о комментариях.
На сегодняшний день технический директор подтверждает, что израильский стартап полностью устранил все неполадки в тестовой среде, приведшие к описанным сбоям. Ни один из четырех американских гигантов искусственного интеллекта не ответил на вопросы журналистов о том, планируют ли они требовать компенсации или возмещения ущерба через суд, рассчитывают ли продолжать партнерство с Irregular в будущем и когда именно они впервые узнали о состоявшихся взломах.






