Компания Google DeepMind сообщила о проведении первого пилотного тестирования проприетарной пограничной модели ИИ с использованием метода двойного слепого оценивания. Проект был реализован в защищенной криптографической среде, которая скрывает как саму модель, так и проверочные промпты от обеих сторон.

В инициативе приняли участие Сингапурский институт безопасности ИИ (Singapore AI Safety Institute), организации OpenMined, AVERI и консорциум MLCommons. Организация AVERI провела оценку модели Gemini 2.5 Flash Lite, используя зарезервированные промпты из бенчмарка безопасности AILuminate от MLCommons. Тестирование охватывало такие направления, как кибератаки, химические и биологические угрозы, разжигание ненависти, побуждение к селфхарму и насильственным преступлениям. Сингапурский AISI отдельно протестировал модель с помощью конфиденциальных промптов, ориентированных на вредоносный контент в контексте Сингапура.
Защита от загрязнения бенчмарков в сфере ИИ
Новый подход решает насущную проблему тестирования искусственного интеллекта, известную как загрязнение бенчмарков. В ситуациях, когда разработчик или сама модель получают доступ к тестовым вопросам заранее, высокий результат может свидетельствовать лишь об осведомленности о бенчмарке, а не о реальных способностях системы.
В компании отметили, что традиционные меры защиты, включая политику нулевого логирования и контрактные ограничения, помогали сохранять конфиденциальность проверочных промптов, однако криптографические средства добавляют дополнительный уровень безопасности.
Обеспечение изоляции данных с помощью Google Cloud
Система функционирует на базе технологии Confidential Computing от Google Cloud, помещая модель ИИ и оценочные данные в изолированную среду. В рамках этой схемы оценщик не получает доступ к весам модели Google, а разработчики не видят тестовые промпты проверяющей стороны.
Пилотный запуск осуществлялся на конфиденциальной виртуальной машине Google Cloud A3 с применением шифрования памяти хоста Intel TDX и конфиденциального графического процессора NVIDIA H100. Аппаратное шифрование и удаленная аттестация позволили изолировать промпты бенчмарка и веса модели с одновременной верификацией программного окружения.
Данное решение призвано устранить давний компромисс при внешнем тестировании ИИ, когда разработчики и независимые эксперты были вынуждены передавать друг другу чувствительные материалы или проприетарные веса моделей. По заявлению Google DeepMind, этот метод особенно полезен для проверок, связанных с кибербезопасностью и государственными ведомствами.
Публикация методологии без раскрытия баллов
Несмотря на обнародование архитектуры тестирования и категорий безопасности, в рамках пилотного проекта не были опубликованы баллы модели или подробные результаты по отдельным задачам. В техническом отчете также отмечаются определенные ограничения: часть проприетарного кода выводов не удалось полностью проинспектировать или внести в списки разрешенных, сборки Confidential Space не воспроизводились независимо, а для подписания и проверки отчета об аттестации применялись сервисы Google.
В консорциум MLCommons подчеркнули, что одной технической секретности недостаточно, а юридическая защита и тщательное управление бенчмарками сохраняют свою важность.
Перспективы независимого тестирования систем искусственного интеллекта
Главное значение эксперимента заключается в проверке того, смогут ли компании в будущем доказывать честность результатов без прямого влияния разработчиков или оценщиков на тесты. Подобные процессы способны упростить независимое тестирование и предоставить ИТ-лидерам весомые доказательства проверки ИИ-моделей на неизведанных ранее бенчмарках.
Тем не менее, для превращения двойного слепого тестирования в признанный отраслевой стандарт методология должна стать независимо воспроизводимой и прозрачной, а сам подход обязан масштабироваться для различных моделей и бенчмарков.
Организация AVERI исследовала модель Gemini 2.5 Flash Lite, опираясь на зарезервированные запросы из бенчмарка безопасности AILuminate, созданного консорциумом MLCommons. Тестовые сценарии охватывали широкий спектр рисков: от масштабных кибератак и создания химических либо биологических угроз до распространения языка вражды, а также побуждения к нанесению вреда самому себе (селфхарму) и совершению насильственных преступлений. В то же время Сингапурский институт безопасности ИИ (Singapore AISI) проводил независимую проверку, задействуя строго конфиденциальные промпты, которые были сфокусированы на определении вредоносного контента с учетом специфического контекста Сингапура.
Применяемая архитектура функционирует на базе передовой технологии Google Cloud Confidential Computing, которая помещает как саму исследуемую модель, так и всю оценочную информацию в защищенную среду выполнения. Задействованный пилотный запуск выполнялся на конфиденциальной виртуальной машине Google Cloud A3, где были задействованы технология шифрования памяти хоста Intel TDX, а также специализированный конфиденциальный графический процессор NVIDIA H100. За счет использования аппаратного шифрования и процедур удаленной аттестации разработчикам удалось надежно изолировать проверочные промпты бенчмарка и веса самой модели, параллельно верифицируя программное окружение.
В опубликованном техническом отчете специалисты DeepMind честно признали ряд существенных ограничений текущей реализации. В частности, часть проприетарного кода, отвечающего за генерацию выводов (inference code), технически не удалось полностью проинспектировать или внести в официальные списки разрешенных элементов (allowlist). Кроме того, отдельные сборки Confidential Space не поддавались независимой воспроизводимости, а для подписания и верификации итогового отчета об аттестации были задействованы стандартные внутренние сервисы Google. Из-за этого компания Google фактически оказалась непосредственно в контуре верификации, что закономерно повышает уровень доверия, необходимый по отношению к самому провайдеру модели.
Представители консорциума MLCommons отдельно подчеркнули, что одной лишь технической секретности и изолированности недостаточно для создания безупречной системы оценки. По их мнению, строгие юридические механизмы защиты и тщательное, аккуратное управление бенчмарками по-прежнему сохраняют свою критическую важность для всей индустрии. Подобная прозрачная и безопасная процедура тестирования в перспективе может кардинально упростить независимую проверку ИИ, избавляя компании от необходимости раскрывать коммерческую тайну или передавать сторонним экспертам ценнейшие веса моделей.
Для руководителей IT-департаментов и корпоративных покупателей, оценивающих заявления различных вендоров, этот метод в будущем способен предоставить гораздо более весомые и объективные доказательства того, что ИИ-модели действительно проверялись на независимых, ранее не опубликованных бенчмарках. Однако эксперты предупреждают: пока процесс не станет полностью воспроизводимым, а детальные результаты не будут открыто опубликованы, покупателям следует внимательно изучать, кто именно поставлял бенчмарк, кто проводил оценку выходных данных, какие конкретные выводы были раскрыты и какие именно участки системы требуют слепого доверия к поставщику технологии.






