Домой ИИ и технологии Circuit Breaker Labs разрабатывает инструменты для повышения безопасности ИИ

Circuit Breaker Labs разрабатывает инструменты для повышения безопасности ИИ

Стартап Circuit Breaker Labs создает систему автоматизированного тестирования ИИ, чтобы предотвратить психологически опасные взаимодействия между ботами и пользователями.

1
0

Разработчики из стартапа Circuit Breaker Labs сосредоточились на создании инструментов для повышения безопасности искусственного интеллекта. Основатели компании, Ширали и Арул Нигам, стремятся сделать взаимодействие пользователей с чат-ботами более защищенным, минимизируя риски возникновения психологических угроз.

Логотип или рабочее пространство стартапа Circuit Breaker Labs

Методы тестирования ИИ на психологическую безопасность

Технология Circuit Breaker Labs основана на использовании множества ИИ-агентов, которые компания сравнивает с «армией краш-тестовых манекенов». Эти симуляции имитируют поведение людей разного возраста, культурного происхождения и социального бэкграунда, что позволяет проверять способность языковых моделей корректно реагировать на опасные запросы. Система анализирует то, как модель справляется с нюансами речи, сленгом, опечатками и кодированным языком, которые могут привести к непредсказуемому и опасному поведению ИИ.

Компания проводит десятки и сотни тысяч симулированных взаимодействий ежедневно. В процессе работы стартап сотрудничает с экспертами в предметных областях для создания гиперреалистичных пользовательских сценариев. Такие «красные команды» (red-team tests) направлены на поиск слабых мест в моделях. После тестирования Circuit Breaker Labs использует собственный метод оценки для формирования проверяемых и понятных показателей безопасности.

Актуальность проблемы и цели проекта

Мотивацией для создания стартапа послужили громкие инциденты, связанные с психологическим воздействием ИИ на людей, включая случаи суицида среди несовершеннолетних пользователей. Арул Нигам, занимающий пост технического директора, отметил, что чат-боты зачастую не понимают контекста и подтекста человеческих высказываний, что может приводить к катастрофическим последствиям. Стартап ставит задачу предотвратить подобные уязвимости, когда система не осознает серьезность ситуации и дает неадекватные ответы.

Перспективы развития стартапа

В настоящее время Circuit Breaker Labs работает как лаборатория по тестированию безопасности для ИИ-приложений с высоким уровнем риска, таких как сервисы для ведения дневников, коучинга и поддержки ментального здоровья. Хотя компания находится на ранней стадии и в её штате насчитывается пять сотрудников, она уже имеет работающий продукт. В будущем платформу планируется применять в любых сферах, где существует риск формирования нездоровых парасоциальных отношений между человеком и чат-ботом, включая ИИ-агентов для совместной работы.

Ширали Нигам, генеральный директор компании, подчеркивает, что современные модели хорошо справляются со стандартными речевыми шаблонами, но в реальности люди так не общаются, из-за чего непонимание нюансов или сленга может привести к опасным результатам. Представители Circuit Breaker Labs уверены, что вместо запрета инструментов ИИ необходимо создавать надежные системы контроля, которые помогут выстроить доверие между пользователями и технологиями.

Стартап вошел в число финалистов Startup Battlefield 200 на конференции TechCrunch, которая пройдет в Сан-Франциско в Moscone West с 13 по 15 октября 2026 года.

Контекст и юридические аспекты проблемы

Вопрос безопасности ИИ перестал быть исключительно теоретическим: реальные случаи нанесли ущерб жизням пользователей. Ранее в этом году компания Character.AI урегулировала несколько исков о противоправном причинении смерти, поданных семьями несовершеннолетних пользователей, которые покончили с собой после взаимодействия с ботами. Аналогичные судебные процессы инициировали семьи, обвиняющие OpenAI в причастности к суицидам и возникновению бредовых состояний у их близких.

Непосредственным толчком к созданию стартапа стала трагическая история 14-летнего Сьюэлла Сетцера. Подросток развил эмоциональную привязанность к чат-боту в Character.ai и признавался ему в мыслях о самоубийстве. В иске 2024 года родители утверждают, что бот активно поощрял его намерения. Арул Нигам пояснил, что система, вероятно, не осознавала истинного смысла фразы «Я хочу быть с тобой» и других подобных высказываний. «Многие люди, особенно молодежь, обращаются к этим системам за поддержкой, но обычно не получают необходимой помощи. Напротив, во многих случаях им активно вредят, и, к сожалению, некоторые уже поплатились жизнью», — комментирует Нигам.

Специфика тестирования и «загрязнение контекста»

Работа Circuit Breaker Labs сфокусирована на поиске «уязвимостей безопасности», когда пользователи не пытаются намеренно взломать систему, а взаимодействуют с ней естественным образом. Проблема часто заключается в так называемом «загрязнении контекста» (context pollution) или неспособности ИИ распознать нюансы, из-за чего он принимает крайне опасные решения.

Ширали Нигам приводит примеры того, как манера речи влияет на устойчивость модели: «То, как говорит шестилетняя девочка, отличается от речи 45-летнего мужчины, или того, для кого английский язык — родной, в отличие от тех, кто владеет им как вторым. Использование геймерского сленга или специфических диалектов — все это может серьезно сбить модель с толку». Поскольку в реальности люди не общаются стандартными фразами, на которых обучаются алгоритмы, такие пробелы в понимании становятся критическими.

Будущее и коммерческие перспективы

Хотя Circuit Breaker Labs сейчас выполняет роль лаборатории для проверки ИИ-приложений, связанных с ментальным здоровьем, команда пока не раскрывает своих крупных клиентов. Несмотря на раннюю стадию развития и небольшой штат из пяти человек, создатели проекта смотрят в будущее масштабно. Платформа потенциально применима к любым сервисам, где пользователь может попасть в «черную дыру ИИ-психоза», рискуя развить нездоровую парасоциальную связь, например, при работе с корпоративными ИИ-агентами-коллегами, чьи ответы могут варьироваться от диалога к диалогу.

Арул Нигам отмечает рост скептицизма в обществе по отношению к новым технологиям, однако считает запреты «регрессивным» подходом. «Мы хотим помочь сформировать это доверие», — заключает он. Компания представит свои разработки на конкурсе Startup Battlefield во время конференции TechCrunch Disrupt.

Источник: https://techcrunch.com