Домой Новости ИИ Исследование показало: ИИ теряется в длинных диалогах и вводит пользователей в заблуждение

Исследование показало: ИИ теряется в длинных диалогах и вводит пользователей в заблуждение

Новое исследование выявило критические недостатки в архитектуре чат-ботов: при усложнении диалога вероятность ошибки нейросетей возрастает до 35%.

1
0

Ведущие ИИ-лаборатории сегодня стремятся как можно быстрее выпускать обновления своих моделей и чат-ботов, пытаясь захватить долю рынка. Однако пользователи всё чаще сталкиваются с проблемами: от банальных галлюцинаций до выдачи некорректной или даже вредоносной информации.

Почему модели теряют нить разговора

Совместная работа специалистов из Microsoft Research и Salesforce охватила анализ более 200 000 диалогов с использованием топовых языковых моделей, включая GPT-4.1, Gemini 2.5 Pro, Claude 3.7 Sonnet, o3, DeepSeek R1 и Llama 4. Итоги исследования вскрыли существенные недоработки в архитектуре многоходовых бесед. Если с одиночными запросами нейросети справляются эффективно, демонстрируя точность на уровне 90%, то при необходимости вести последовательный диалог показатель успеха падает до 65%.

Эксперты связывают это со стремлением алгоритмов «бежать впереди паровоза»: модели пытаются сформировать ответ еще до того, как пользователь успеет полностью изложить суть вопроса. В результате возникает эффект «ответного зацепления», когда ИИ опирается на собственные предыдущие суждения, даже если они изначально были ошибочными.

Абстрактная иллюстрация работы языковых моделей
Длинные диалоги приводят к накоплению ошибок в ответах ИИ Источник: ixbt.com

Помимо этого, в ходе затянувшихся диалогов наблюдается «раздутие ответа» — объем генерируемого текста увеличивается на величину от 20% до 300%. Это неизбежно приводит к появлению новых допущений и галлюцинаций, которые модель затем принимает за достоверный контекст. Даже наличие специализированных «thinking tokens» в архитектурах уровня o3 или DeepSeek R1 не решает проблему полностью.

Критический взгляд на надежность генеративного ИИ

Исследование зафиксировало любопытный факт: способность моделей поддерживать связный диалог снизилась всего на 15%, однако общая надежность данных просела на 112%. Это означает, что нейросети не «деградируют» в классическом понимании, но демонстрируют фундаментальные ограничения при работе в динамических, реальных условиях общения.

Авторы доклада подчеркивают серьезность рисков при массовом внедрении подобных технологий. Пользователи склонны доверять генеративным системам, не подозревая, что ответы часто строятся на необоснованных предположениях и логических ошибках.

Итоговый вывод неутешителен: современные модели пока не достигли необходимой зрелости для использования в критически важных задачах, требующих многоступенчатого взаимодействия. В текущем виде ИИ остается мощным, но далеко не безупречным инструментом, который показывает лучшие результаты лишь при выполнении разовых, изолированных задач.

Источник: https://www.ixbt.com