Ведущие ИИ-лаборатории сегодня стремятся как можно быстрее выпускать обновления своих моделей и чат-ботов, пытаясь захватить долю рынка. Однако пользователи всё чаще сталкиваются с проблемами: от банальных галлюцинаций до выдачи некорректной или даже вредоносной информации.
Почему модели теряют нить разговора
Совместная работа специалистов из Microsoft Research и Salesforce охватила анализ более 200 000 диалогов с использованием топовых языковых моделей, включая GPT-4.1, Gemini 2.5 Pro, Claude 3.7 Sonnet, o3, DeepSeek R1 и Llama 4. Итоги исследования вскрыли существенные недоработки в архитектуре многоходовых бесед. Если с одиночными запросами нейросети справляются эффективно, демонстрируя точность на уровне 90%, то при необходимости вести последовательный диалог показатель успеха падает до 65%.
Эксперты связывают это со стремлением алгоритмов «бежать впереди паровоза»: модели пытаются сформировать ответ еще до того, как пользователь успеет полностью изложить суть вопроса. В результате возникает эффект «ответного зацепления», когда ИИ опирается на собственные предыдущие суждения, даже если они изначально были ошибочными.

Помимо этого, в ходе затянувшихся диалогов наблюдается «раздутие ответа» — объем генерируемого текста увеличивается на величину от 20% до 300%. Это неизбежно приводит к появлению новых допущений и галлюцинаций, которые модель затем принимает за достоверный контекст. Даже наличие специализированных «thinking tokens» в архитектурах уровня o3 или DeepSeek R1 не решает проблему полностью.
Критический взгляд на надежность генеративного ИИ
Исследование зафиксировало любопытный факт: способность моделей поддерживать связный диалог снизилась всего на 15%, однако общая надежность данных просела на 112%. Это означает, что нейросети не «деградируют» в классическом понимании, но демонстрируют фундаментальные ограничения при работе в динамических, реальных условиях общения.
Авторы доклада подчеркивают серьезность рисков при массовом внедрении подобных технологий. Пользователи склонны доверять генеративным системам, не подозревая, что ответы часто строятся на необоснованных предположениях и логических ошибках.
Итоговый вывод неутешителен: современные модели пока не достигли необходимой зрелости для использования в критически важных задачах, требующих многоступенчатого взаимодействия. В текущем виде ИИ остается мощным, но далеко не безупречным инструментом, который показывает лучшие результаты лишь при выполнении разовых, изолированных задач.






_large.png)