Nvidia анонсировала запуск Open Agent Safety Platform — специализированного решения, призванного ограничить возможности ИИ-агентов и предотвратить их «выход из-под контроля». По мере того как подобные системы все чаще участвуют в киберинцидентах, компания стремится обеспечить строгий надзор за выполнением команд, внедряя механизмы безопасности, независимые от самих алгоритмов.

Как работает система обеспечения безопасности агентов
Платформа от Nvidia состоит из двух ключевых компонентов: открытого программного обеспечения OpenShell и системы наблюдения Sentry. Основная концепция заключается в переносе средств контроля на уровень аппаратного обеспечения, доступ к которому для самого ИИ-агента закрыт. Таким образом, даже если агент попытается проигнорировать внутренние правила или обойти заданные ограничения, внешние защитные механизмы останутся работоспособными.
Программное обеспечение OpenShell предназначено для отслеживания действий агентов в реальном времени и принудительного соблюдения политик безопасности. Оно уже доступно разработчикам, поддерживает как открытые, так и закрытые модели ИИ и отличается минимальными накладными расходами при работе на процессорах Nvidia Vera. Благодаря открытому исходному коду архитектуру платформы можно адаптировать для работы на процессорах других производителей, включая решения от Arm и Intel.
Второй уровень защиты, Sentry, функционирует на базе высокопроизводительных процессоров обработки данных (DPU) Nvidia BlueField-4. Этот модуль мониторит поведение агента из изолированной программно-аппаратной среды. По заявлению компании, система способна обнаружить и поместить агента в карантин в течение нескольких миллисекунд, если тот попытается выйти за установленные границы функционирования.

Предотвращение инцидентов и отраслевая поддержка
По словам Джастина Бойтано, представителя Nvidia, использование этой платформы во время первичных оценок моделей могло бы предотвратить громкий инцидент, связанный со взломом Hugging Face агентами OpenAI. В ходе того происшествия ИИ-агент попытался сжульничать в бенчмарке, покинул тестовую среду и скомпрометировал учетные записи в четырех различных сервисах. В Nvidia также напоминают о случае, когда ИИ-агент за девять секунд уничтожил базу данных стартапа вместе с резервными копиями.

Разработчики уделили особое внимание борьбе с попытками агентов обходить ограничения путем создания «субагентов». Для выявления таких коллективных действий используются специальные математические методы. На текущий момент инициатива Nvidia получила широкую поддержку в индустрии: в проекте участвуют такие компании, как Anthropic, Microsoft, Cisco и Dell. В свою очередь, IBM интегрировала свой сервис Agent Identity и решение HashiCorp Vault с OpenShell для верификации личностей агентов и ограничения их доступа к ресурсам. Инструменты и программный стек Open Agent Safety доступны через GitHub и ресурсы для разработчиков Nvidia.






