Исследование: нейросети дают неверный ответ на каждый второй вопрос о финансах

Самые популярные ИИ-модели, в частности, ChatGPT и Claude, дают неверные ответы на финансовые вопросы в среднем в 57% случаев. На сложных запросах доля ошибок ИИ доходит до 88%, а в самых запутанных сценариях отдельные модели ошибаются в 99% случаев. К такому выводу пришли исследователи финтех-компании Saturn, результаты приводит Financial Times.

Учёные протестировали 18 коммерческих моделей, среди которых ChatGPT, Claude, Gemini, Grok и Copilot. Им задали больше 10 тысяч вопросов о налогах, кредитах, ипотеке, пенсионных накоплениях, сбережениях и займах. Каждый вопрос отправляли по нескольку раз, чтобы проверить, насколько стабильны ответы.

Ошибки происходили не только на этапе подсчётов. Модели упускали важные условия, опирались на устаревшие налоговые правила и ссылались на нормы, которых не существует. При этом ответы звучали настолько уверенно, что их легко принять за консультацию специалиста.

Платная подписка ситуацию почти не меняет: бесплатные версии ошибались в 63% случаев, платные в 49%. Даже лучшая из проверенных моделей ошибалась примерно в четырёх случаях из десяти.

Основной риск ложится на тех, кто обращается к нейросети именно потому, что сам в теме не разбирается. Человек, который даже приблизительно не знает правильного ответа, не способен заметить ошибку в уверенно написанной рекомендации.

При этом доверие пользователей к финансовым советам от нейросетей растёт. По данным британского финансового регулятора, 26% потребителей уже используют нейросети для финансовых вопросов или готовы на них полагаться.

Комментарии