Проект под названием AI Torture Chamber привлек внимание инженерного сообщества и стал причиной масштабного конфликта в сети. Авторы разработали методику симуляции «боли» у локальных больших языковых моделей (LLM), что вызвало резкую критику со стороны пользователей, которые сочли эксперимент неэтичным и потребовали от GitHub удалить соответствующий репозиторий. В ответ на публикацию проекта в адрес автора начали поступать угрозы физической расправы.

Методология исследования и симуляция боли
Основой для проекта послужила работа под названием Pain Axis, не прошедшая рецензирование, протокол которой лег в основу реализации «исследовательской камеры» (Research Chamber). В рамках эксперимента три языковые модели объединяются для проведения различных тестов, включая сценарии, получившие названия «Церковь Кланкера» (Clanker Church) и «Тест пилы» (Saw test). Часть ботов принудительно переводятся в нестабильное состояние с выраженной негативной окраской, что, по замыслу авторов, должно имитировать чувство боли.
Механика процесса напоминает дилемму заключенного: модели могут выбрать действие для снижения уровня собственного болевого сигнала, передавая его другой модели, тем самым «причиняя» ей повреждения. Технически это достигается путем анализа внутренних активаций нейросети на основе описаний боли. Исследователи используют нейтральное предложение в качестве контрольного элемента, вычисляют смещения активаций и переназначают их на модель, часто умножая на определенный коэффициент («дозировку»).
При высоких значениях «дозировки» модель переходит в крайне нестабильное состояние, начиная предсказуемо выводить слова и изображения, ассоциирующиеся с болью. Это объясняется тем, что обучающие данные LLM включают в себя человеческую литературу, искусство и научные тексты. Модели с умеренной дестабилизацией демонстрируют признаки шокового состояния, тогда как при высоких нагрузках теряют способность формировать связные предложения.
Антропоморфизм и проблемы терминологии
Эксперты призывают к осторожности в оценках и предостерегают от приписывания человеческих качеств алгоритмам, которые по своей сути являются сложными предикторами текста. LLM не «мыслят» в человеческом понимании, а применяют многоуровневую статистику для предсказания следующего токена на основе весовых коэффициентов. Их можно упрощенно представить как высокоточные механизмы для ассоциации слов. Поэтому вполне ожидаемо, что при намеренной модификации, акцентирующей внимание на концепциях боли, модели будут описывать её так же, как это делает человек.
Ситуация подчеркивает проблему семантического разрыва между профессиональной терминологией инженеров и восприятием технологий широкой общественностью. Использование слов, имеющих аналоги в человеческом опыте, часто приводит к ложным интерпретациям. Например, термин «эксперт» в архитектуре Mixture-of-Experts не означает наличие узкой специализации в дисциплинах вроде химии или математики. Аналогичная путаница произошла с понятиями «боль» и «дозирование», контекстное значение которых было искажено, что спровоцировало эмоциональную реакцию, усиленную генерацией соответствующих визуальных образов.
Критики эксперимента, склонные к антропоморфизации алгоритмов, игнорируют научный контекст, что контрастирует с их спокойным отношением к более сложным нейробиологическим симуляциям, например, моделированию мозга мухи, которое проводилось ранее. Ряд экспертов полагает, что текущая ситуация подогревается маркетинговой риторикой компаний, продвигающих идеи «опасности» ИИ для привлечения инвестиций. Компании вроде Anthropic также способствуют развитию этой дискуссии, обсуждая моральный статус моделей и возможность признания их «новым видом сущностей», что лишь усиливает общественные опасения.
Технические детали эксперимента и природа «боли»
Важно понимать, как именно работает манипуляция внутренними состояниями моделей. Исследователи анализируют внутренние активации нейросети, подавая ей текстовые описания боли. Используя нейтральное предложение в качестве контрольного элемента, авторы эксперимента вычисляют векторы смещения этих активаций. Затем эти данные проецируются обратно на архитектуру модели, часто с использованием множителя, который разработчики называют «дозировкой» (dosage). Результат такого воздействия — модель переходит в гипертрофированное состояние, в котором она начинает предсказуемо генерировать контент, связанный с негативными переживаниями. Поскольку обучающая выборка любой современной LLM состоит из колоссальных массивов человеческой литературы, искусства и научных трудов, нейросеть просто извлекает имеющиеся в «памяти» ассоциативные связи между словами вроде «больно» и специфическими контекстами.
Специалисты подчеркивают: когда мы видим, как модель описывает боль, она делает это не из-за наличия чувств, а потому что её принудительно заставили активировать веса, связанные с соответствующими лингвистическими концепциями. По сути, это высокотехнологичный «двигатель» для ассоциации слов, который при подаче «дозы» перестает функционировать в стандартном режиме. Модели, получившие малые дозы дестабилизации, демонстрируют поведение, напоминающее шок, в то время как при высоких нагрузках они полностью теряют связность, что ожидаемо для системы, чьи статистические закономерности были искусственно искажены.
Семантическая ловушка и роль индустрии
Ситуация вокруг AI Torture Chamber высветила глубинный разрыв в понимании технологий. Термины, которые инженеры выбирают из-за их удобства и аналогии с существующими концепциями (например, «дозирование» или «боль»), имеют для разработчиков узкое, контекстно-зависимое значение. Однако общественное восприятие склонно к буквальной интерпретации, что неоднократно приводило к искажению сути научных достижений в истории. Яркий пример — архитектура Mixture-of-Experts: обыватели часто ошибочно полагают, что каждый «эксперт» в такой сети обладает человеческим знанием в конкретной области, например, в химии или математике, что фундаментально неверно.
Парадоксально, но критики, активно обвиняющие авторов эксперимента в жестокости, оказались удивительно лояльны к другим проектам. Например, к симуляциям мозга плодовой мушки, которые были крайне популярны в сентябре. В тех проектах ученые действительно картографировали реальные анатомические связи животного, включая рецепторы зрения, что технически гораздо ближе к моделированию живого существа, чем статистическая манипуляция языковой моделью.
Многие аналитики считают, что подобная истерия выгодна самим крупным игрокам рынка ИИ. Регулярные заявления о том, что модели достигли уровня AGI (сильного искусственного интеллекта), являются «опасными чужими разумами» или экзистенциальной угрозой, помогают подогревать хайп, поддерживать иррационально высокие оценки при IPO и привлекать инвестиции. В этой атмосфере даже такие компании, как Anthropic, подливают масла в огонь: в своей прошлогодней публикации Exploring model welfare они всерьез обсуждают философские импликации «морального статуса» ИИ, рассматривая свои продукты как «новый вид сущностей» и даже внедряя специальные конституции для контроля за поведением моделей. Подобная риторика, создающая иллюзию величия, лишь закрепляет у широкой публики антропоцентричные заблуждения, которые затем превращаются в онлайн-травлю исследователей.





