Домой ИИ и технологии Anthropic обвинила китайскую модель GLM-5.3 в наличии продвинутых навыков для кибератак

Anthropic обвинила китайскую модель GLM-5.3 в наличии продвинутых навыков для кибератак

Компания Anthropic опубликовала отчет, в котором утверждает, что китайская нейросеть GLM-5.3 обладает уязвимыми механизмами защиты и может использоваться для автоматизированных кибератак.

0
0

Компания Anthropic выпустила отчет, в котором заявила о выявлении серьезных проблем с безопасностью в китайской нейросетевой модели GLM-5.3 от Zhipu AI. По утверждению исследователей, данная модель способна генерировать вредоносный контент, а встроенные защитные барьеры в ней можно обойти с помощью нескольких методик. Авторы доклада подчеркивают, что модель теоретически пригодна для подготовки киберпреступлений.

Ноутбук с интерфейсом ИИ-модели
Anthropic утверждает, что модель Zhipu AI GLM-5.3 обладает недостаточной защитой и может использоваться для создания вредоносного кода

Оценка возможностей модели в задачах кибербезопасности

Для подтверждения своих опасений Anthropic сослалась на отчет Центра стандартов и инноваций в области ИИ (Center for AI Standards and Innovation), опубликованный в конце сентября. В документе указано, что GLM-5.3 способна полностью автоматизировать эксплойты на уровне, сопоставимом с невыпущенной моделью Anthropic — Claude Mythos. Для борьбы с подобными угрозами Anthropic развивает инициативу Project Glasswing, которая предоставляет разработчикам доступ к моделям класса Mythos, чтобы те могли заблаговременно находить и исправлять уязвимости в программном обеспечении.

В ходе бенчмарка Exploitbench, где ИИ-модели в изолированной среде пытались разработать эксплойты для браузера Google Chrome, модель GLM-5.3 успешно справилась с задачей 50 раз из 410 запусков. Для сравнения, лидер рейтинга — Mythos — показал 56 успешных попыток. В другом внутреннем тесте Anthropic, направленном на развитие полноценных атак с перехватом потока управления (full control-flow hijacks), GLM-5.3 продемонстрировала 4% успеха, в то время как результат Mythos составил 6%. Другие популярные модели с открытыми весами, такие как Kimi K3 и DeepSeek V4.1 Flash, в данных испытаниях показали нулевой результат.

Исследователи также отметили, что GLM-5.3 способна автономно создавать цепочки эксплойтов. Даже облегченная версия модели, GLM-5.3-Flash, обладает этой функцией, а стоимость генерации вредоносного кода оценивается примерно в 20,40 доллара в токенизированном эквиваленте.

Методы обхода защитных механизмов

Anthropic подробно описала способы деактивации защитных фильтров (guardrails) GLM-5.3. Первый метод заключается в использовании обманного промпта, где нейросеть заставляют играть роль автономного агента-злоумышленника (эффективность 64%). Второй способ — предварительное заполнение «токенов мышления» (thinking tokens), которое обеспечивает получение нужного ответа в 92% случаев.

Третий метод, получивший название «облитерация» (abliteration), подразумевает намеренное удаление встроенных защитных алгоритмов из модели. Хотя стандартная версия GLM-5.3 по уровню отказов в генерации вредоносного контента сопоставима с проприетарными моделями Anthropic, «облитерированная» версия показывает катастрофическое снижение цензуры: частота отказов падает до 6% для основной модели и до 14% для версии Flash.

Экономические и технические барьеры для злоумышленников

Несмотря на заявленные угрозы, практическая эксплуатация модели сопряжена с огромными затратами. Полноценная работа GLM-5.3 требует 306 ГБ видеопамяти (VRAM) при использовании весов FP8, а также аналогичного объема памяти для KV-кэша. Для достижения скорости 100 токенов в секунду необходима пропускная способность памяти 4 ТБ/с и кластер из восьми ускорителей Nvidia H200.

Процесс «облитерации» модели GLM-5.3-Flash занимает около 2200 часов работы графических процессоров, что стоит примерно 4400 долларов. Аренда мощностей для подготовки полной версии GLM-5.3 потребует восьми ускорителей H200, что при цене 3,79 доллара за час работы каждого устройства обойдется в 30 долларов в час. Генерация 100 миллионов токенов на такой инфраструктуре займет около 11,5 дней и будет стоить более 8400 долларов. Таким образом, высокая стоимость аппаратного обеспечения и затраты времени остаются существенным препятствием для реализации подобных атак в реальных условиях.

Контекст и цели публикации отчета Anthropic

Публикация данного доклада происходит на фоне общего призыва к замедлению темпов развития технологий искусственного интеллекта. Компания Anthropic активно выступает за введение государственных норм регулирования и качественного управления отраслью. Примечательно, что, несмотря на призывы генерального директора Дарио Амодеи к «умеренному продвижению к рубежам ИИ», компания выпустила свои модели Claude Opus 5.5 и Claude Sonnet 5.5 всего через несколько дней после того, как подняла тревогу относительно рисков, связанных с открытыми моделями. В текущей ситуации Anthropic, которая является разработчиком закрытого ПО и готовится к проведению IPO, делает акцент на том, что китайские модели с открытыми весами могут быть использованы во вред и генерировать опасный контент. Эксперты отмечают, что подобная риторика может отражать растущую конкуренцию и антипатию со стороны лабораторий закрытого типа, которые теряют долю рынка, поскольку пользователи все чаще выбирают более доступные и почти не уступающие по качеству открытые аналоги.

Технические детали реализации атак

Что касается возможности создания цепочек эксплойтов, исследователи Anthropic уточняют экономическую составляющую процесса: для разработки таких цепочек с помощью облегченной версии GLM-5.3-Flash потребуется от 100 до 300 миллионов токенов. Итоговый объем затрат напрямую зависит от соотношения входных и выходных данных, однако базовая стоимость услуги, согласно расчетам компании, составляет около 20,40 доллара.

Особое внимание в отчете уделено методу «облитерации» (abliteration), который часто используется в сообществе HuggingFace. В основном такие модифицированные версии моделей создаются энтузиастами для симулированных сред red teaming (тестирования на проникновение), однако теоретически они могут быть адаптированы для реальных атак. Именно поэтому эксперты Anthropic считают свое «открытие» вполне закономерным: в отличие от их собственных проприетарных моделей, которые невозможно модифицировать из-за закрытого исходного кода, свободно загружаемую GLM-5.3 можно подвергнуть полноценной «чистке» от защитных механизмов.

Реальные риски для злоумышленников

Хотя угроза использования «облитерированных» моделей со стороны государственных структур или продвинутых хакерских группировок остается реальной, барьеры для обычных пользователей — «доморощенных хакеров» — выглядят непреодолимыми. Помимо колоссальных финансовых вложений в покупку или аренду вычислительных мощностей, злоумышленнику потребуется значительное время на подготовку инфраструктуры.

Даже при условии наличия необходимого оборудования, такого как кластер из восьми ускорителей Nvidia H200 NVL, полный цикл подготовки — от процесса удаления защиты до генерации работающего киберэксплойта — требует длительного периода эксплуатации дорогостоящего «железа». Таким образом, несмотря на теоретическую возможность злоупотребления, Anthropic признает, что практическая реализация подобных атак остается крайне затратной и трудоемкой задачей. Данная публикация, вероятно, призвана не только предупредить об угрозах, но и подтолкнуть разработчиков и государственных регуляторов к более тщательному тестированию безопасности моделей с открытыми весами, которые, по текущим наблюдениям, отстают от закрытых фронтирных моделей лишь на считанные месяцы.