Домой Новости ИИ Google DeepMind испытала закрытый метод оценки ИИ через криптозащиту

Google DeepMind испытала закрытый метод оценки ИИ через криптозащиту

Google DeepMind применила криптографическую защиту для независимой оценки модели Gemini 2.5 Flash Lite, предотвратив утечку тестовых данных.

3
0

Компания Google DeepMind сообщила о проведении первого пилотного тестирования проприетарной пограничной модели ИИ с использованием метода двойного слепого оценивания. Проект был реализован в защищенной криптографической среде, которая скрывает как саму модель, так и проверочные промпты от обеих сторон.

Серверное оборудование Google Cloud в дата-центре

В инициативе приняли участие Сингапурский институт безопасности ИИ (Singapore AI Safety Institute), организации OpenMined, AVERI и консорциум MLCommons. Организация AVERI провела оценку модели Gemini 2.5 Flash Lite, используя зарезервированные промпты из бенчмарка безопасности AILuminate от MLCommons. Тестирование охватывало такие направления, как кибератаки, химические и биологические угрозы, разжигание ненависти, побуждение к селфхарму и насильственным преступлениям. Сингапурский AISI отдельно протестировал модель с помощью конфиденциальных промптов, ориентированных на вредоносный контент в контексте Сингапура.

Защита от загрязнения бенчмарков в сфере ИИ

Новый подход решает насущную проблему тестирования искусственного интеллекта, известную как загрязнение бенчмарков. В ситуациях, когда разработчик или сама модель получают доступ к тестовым вопросам заранее, высокий результат может свидетельствовать лишь об осведомленности о бенчмарке, а не о реальных способностях системы.

В компании отметили, что традиционные меры защиты, включая политику нулевого логирования и контрактные ограничения, помогали сохранять конфиденциальность проверочных промптов, однако криптографические средства добавляют дополнительный уровень безопасности.

Обеспечение изоляции данных с помощью Google Cloud

Система функционирует на базе технологии Confidential Computing от Google Cloud, помещая модель ИИ и оценочные данные в изолированную среду. В рамках этой схемы оценщик не получает доступ к весам модели Google, а разработчики не видят тестовые промпты проверяющей стороны.

Пилотный запуск осуществлялся на конфиденциальной виртуальной машине Google Cloud A3 с применением шифрования памяти хоста Intel TDX и конфиденциального графического процессора NVIDIA H100. Аппаратное шифрование и удаленная аттестация позволили изолировать промпты бенчмарка и веса модели с одновременной верификацией программного окружения.

Данное решение призвано устранить давний компромисс при внешнем тестировании ИИ, когда разработчики и независимые эксперты были вынуждены передавать друг другу чувствительные материалы или проприетарные веса моделей. По заявлению Google DeepMind, этот метод особенно полезен для проверок, связанных с кибербезопасностью и государственными ведомствами.

Публикация методологии без раскрытия баллов

Несмотря на обнародование архитектуры тестирования и категорий безопасности, в рамках пилотного проекта не были опубликованы баллы модели или подробные результаты по отдельным задачам. В техническом отчете также отмечаются определенные ограничения: часть проприетарного кода выводов не удалось полностью проинспектировать или внести в списки разрешенных, сборки Confidential Space не воспроизводились независимо, а для подписания и проверки отчета об аттестации применялись сервисы Google.

В консорциум MLCommons подчеркнули, что одной технической секретности недостаточно, а юридическая защита и тщательное управление бенчмарками сохраняют свою важность.

Перспективы независимого тестирования систем искусственного интеллекта

Главное значение эксперимента заключается в проверке того, смогут ли компании в будущем доказывать честность результатов без прямого влияния разработчиков или оценщиков на тесты. Подобные процессы способны упростить независимое тестирование и предоставить ИТ-лидерам весомые доказательства проверки ИИ-моделей на неизведанных ранее бенчмарках.

Тем не менее, для превращения двойного слепого тестирования в признанный отраслевой стандарт методология должна стать независимо воспроизводимой и прозрачной, а сам подход обязан масштабироваться для различных моделей и бенчмарков.

Организация AVERI исследовала модель Gemini 2.5 Flash Lite, опираясь на зарезервированные запросы из бенчмарка безопасности AILuminate, созданного консорциумом MLCommons. Тестовые сценарии охватывали широкий спектр рисков: от масштабных кибератак и создания химических либо биологических угроз до распространения языка вражды, а также побуждения к нанесению вреда самому себе (селфхарму) и совершению насильственных преступлений. В то же время Сингапурский институт безопасности ИИ (Singapore AISI) проводил независимую проверку, задействуя строго конфиденциальные промпты, которые были сфокусированы на определении вредоносного контента с учетом специфического контекста Сингапура.

Применяемая архитектура функционирует на базе передовой технологии Google Cloud Confidential Computing, которая помещает как саму исследуемую модель, так и всю оценочную информацию в защищенную среду выполнения. Задействованный пилотный запуск выполнялся на конфиденциальной виртуальной машине Google Cloud A3, где были задействованы технология шифрования памяти хоста Intel TDX, а также специализированный конфиденциальный графический процессор NVIDIA H100. За счет использования аппаратного шифрования и процедур удаленной аттестации разработчикам удалось надежно изолировать проверочные промпты бенчмарка и веса самой модели, параллельно верифицируя программное окружение.

В опубликованном техническом отчете специалисты DeepMind честно признали ряд существенных ограничений текущей реализации. В частности, часть проприетарного кода, отвечающего за генерацию выводов (inference code), технически не удалось полностью проинспектировать или внести в официальные списки разрешенных элементов (allowlist). Кроме того, отдельные сборки Confidential Space не поддавались независимой воспроизводимости, а для подписания и верификации итогового отчета об аттестации были задействованы стандартные внутренние сервисы Google. Из-за этого компания Google фактически оказалась непосредственно в контуре верификации, что закономерно повышает уровень доверия, необходимый по отношению к самому провайдеру модели.

Представители консорциума MLCommons отдельно подчеркнули, что одной лишь технической секретности и изолированности недостаточно для создания безупречной системы оценки. По их мнению, строгие юридические механизмы защиты и тщательное, аккуратное управление бенчмарками по-прежнему сохраняют свою критическую важность для всей индустрии. Подобная прозрачная и безопасная процедура тестирования в перспективе может кардинально упростить независимую проверку ИИ, избавляя компании от необходимости раскрывать коммерческую тайну или передавать сторонним экспертам ценнейшие веса моделей.

Для руководителей IT-департаментов и корпоративных покупателей, оценивающих заявления различных вендоров, этот метод в будущем способен предоставить гораздо более весомые и объективные доказательства того, что ИИ-модели действительно проверялись на независимых, ранее не опубликованных бенчмарках. Однако эксперты предупреждают: пока процесс не станет полностью воспроизводимым, а детальные результаты не будут открыто опубликованы, покупателям следует внимательно изучать, кто именно поставлял бенчмарк, кто проводил оценку выходных данных, какие конкретные выводы были раскрыты и какие именно участки системы требуют слепого доверия к поставщику технологии.