Домой ИИ и технологии Новое исследование: нейросети дают неверные финансовые советы в большинстве случаев

Новое исследование: нейросети дают неверные финансовые советы в большинстве случаев

Исследование компании Saturn показало, что популярные чат-боты допускают ошибки в финансовых вопросах в 57% случаев. При сложных сценариях показатель неточности достигает 88%.

1
0

Использование генеративного искусственного интеллекта для поиска финансовых советов стало одним из самых популярных сценариев применения технологии. Согласно данным Intuit Credit Karma, 66% американских пользователей нейросетей уже обращались к ним за рекомендациями по управлению деньгами, а среди представителей поколений Z и миллениалов этот показатель достигает 82%. Финансовая сфера занимает второе место по востребованности среди пользователей GenAI (41%), уступая лишь вопросам здоровья и благополучия (44%).

инструменты искусственного интеллекта
(Image credit: Shutterstock)

Ненадежность ИИ в вопросах личных финансов

Однако эксперты предостерегают от чрезмерного доверия к алгоритмам. Аналитическая компания Saturn провела исследование под названием «Artificial Authority», в рамках которого протестировала 18 популярных ИИ-инструментов, включая ChatGPT, Gemini, Claude и Copilot. Результаты тестов оказались тревожными: при ответе на финансовые вопросы модели чаще ошибались, чем давали верную информацию.

В ходе тестирования 17 различных нейросетей средний показатель точности составил всего 43%. Это означает, что в 57% случаев чат-боты предоставляли пользователям неверные или неполные данные. Ситуация значительно ухудшается при работе с многоэтапными сценариями, связанными с налоговым законодательством или специфическими финансовыми расчетами: в таких задачах точность нейросетей падает до 12%, а доля ошибок возрастает до 88%.

Различия в работе бесплатных и платных моделей

Исследование выявило закономерность: платные версии нейросетей демонстрируют более высокую эффективность, чем бесплатные. Так, бесплатные модели допустили ошибки в 63% случаев, тогда как платные — в 49%. Среди бесплатных решений наихудший результат показала Claude Haiku 4.5 (82% ошибок), а лучшим оказался ChatGPT-5.6 Luna (max), который ошибался в 56% случаев.

Лучшим среди всех протестированных инструментов стал платный чат-бот Anthropic Claude Opus 5 (reasoning), показавший точность 61%. Несмотря на лидерство, данная модель все равно выдавала некорректные ответы в четырех из десяти случаев. При усложнении запросов частота ошибок у Claude Opus 5 увеличивалась до 67%.

Последствия использования неверных советов

Особое внимание в отчете Saturn уделено примерам того, как некомпетентность ИИ может привести к тяжелым финансовым последствиям для пользователей. Например, одна из моделей ошибочно заявила, что выпускник вуза может прекратить выплаты по студенческому кредиту при переезде за границу, хотя в реальности это решение может привести к увеличению ежемесячных платежей. В другом случае чат-бот Gemini дезинформировал пользователя, сообщив, что оформление кредитных каникул по ипотеке не отразится на его кредитном рейтинге.

Данные выводы контрастируют с ожиданиями рынка. Отчет EY за март 2026 года показал, что 53% респондентов предпочитают использовать ИИ-ассистентов для принятия инвестиционных решений, а 14% готовы делегировать эти задачи автономному ИИ. Эксперты Saturn предупреждают, что результаты их исследования должны заставить пользователей отказаться от консультаций с чат-ботами по критически важным темам: управлению долгами, ипотечному кредитованию, пенсионному планированию и налогам на наследство.

финансовые советы — иллюстрация 2 к материалу

Детальный разбор «Artificial Authority»: почему ИИ опасен для вашего кошелька

Исследование команды Domain из компании Saturn ставит под сомнение целесообразность использования чат-ботов в качестве персональных финансовых консультантов. Масштабное тестирование охватило 18 наиболее популярных моделей на рынке, включая ведущие решения от OpenAI, Google и Anthropic. Ключевой вывод отчета «Artificial Authority» звучит как суровое предупреждение: на текущий момент нейросети демонстрируют пугающе низкий уровень надежности при обработке запросов, касающихся легитимного финансового планирования и управления активами.

Статистика провалов: от простых вопросов к сложным сценариям

Аналитики Saturn сфокусировались на способности алгоритмов давать точные ответы в условиях, когда ошибка может стоить пользователю реальных денег. Полученные метрики подчеркивают системную проблему галлюцинаций ИИ:

  • Общая точность: Средний показатель для 17 протестированных моделей составил всего 43%. Это означает, что почти в 6 случаях из 10 чат-бот не предоставит корректной финансовой консультации.
  • Сложные задачи: При попытке проанализировать многоступенчатые сценарии, затрагивающие налоговые правила или необходимость выполнения точных вычислений, точность катастрофически снижается до 12%. В 88% подобных кейсов пользователи рискуют получить рекомендации, которые противоречат действующему законодательству или финансовой логике.

Ценовой фактор: платные модели не гарантируют безопасности

Хотя разделение на платные и бесплатные версии показывает предсказуемый разрыв, даже покупка премиум-подписки не обеспечивает требуемого уровня экспертности:

  • Бесплатные модели проваливали задания в 63% случаев. Наихудшим представителем этого сегмента стала Claude Haiku 4.5, допустившая неточности в 82% ответов. Наиболее «компетентной» среди бесплатных оказалась ChatGPT-5.6 Luna (max) с показателем ошибок 56%.
  • Платные модели показали чуть более обнадеживающий, но всё еще недостаточный результат — 49% ошибок. Лидером стала модель Anthropic Claude Opus 5 (reasoning), которая смогла дать правильный ответ в 61% случаев. Однако даже этот «отличник» ошибается в четырех из десяти запросов, а при усложнении задачи доля брака возрастает до 67%.

Риски конкретных ошибок и дальнейшие перспективы

Отчет Saturn детально иллюстрирует, что цена ошибки ИИ — это не просто неверная цифра, а неверная жизненная стратегия. ИИ может давать опасные рекомендации, которые ведут к прямому ущербу:

«Одна из протестированных моделей ошибочно советовала выпускнику колледжа прекратить выплаты по студенческому кредиту при смене страны проживания, хотя это может привести к росту ежемесячных платежей. Аналогично, модель Gemini ввела пользователя в заблуждение относительно влияния кредитных каникул по ипотеке на кредитный рейтинг».

Несмотря на то, что отчет EY от марта 2026 года фиксирует высокий уровень доверия (53% респондентов предпочитают помощь ИИ при инвестировании, а 14% готовы довериться автономным системам), результаты тестов Saturn призывают к радикальному пересмотру такого подхода. Эксперты подчеркивают: использование чат-ботов для работы с долгами, ипотекой, налогами на наследство и пенсионным планированием остается неоправданным риском, способным привести к серьезным финансовым потерям вместо ожидаемого роста капитала.

Источник: https://www.tomsguide.com