Как часто ИИ врет и ошибается в финансовых советах

Фото: pch.vector, Magnific.com
Компания Saturn протестировала ChatGPT, Claude, Copilot, Grok и Gemini по финансовым вопросам.
Добавить в основныеисточники Google
Популярные чат-боты часто дают неправильные ответы на финансовые вопросы, следует из результатов исследования, проведенного компанией Saturn.
ChatGPT, Claude, Copilot, Grok и Gemini давали ошибочные советы в среднем в 57% случаев, если запрос был сложнее и требовал нескольких расчетов – количество ошибок возрастало до 88%.
В ходе исследования было проверено более 100 различных вопросов, связанных с деньгами, – и на платных, и на бесплатных версиях. В целом 18 моделей получили более 10 000 запросов, причем каждый вопрос могли повторять до пяти раз.
ИИ-модели ошибались в финансовых расчетах, игнорировали грядущие изменения налогового законодательства, использовали выдуманные правила и давали неправильные ответы на сложные запросы, требовавшие нескольких вычислений.
Некоторе модели при сложных вопросах ошибались в 99% случаев. Лучший результат был у Claude Opus 5 в режиме «рассуждения», однако даже у этой модели 39% ответов оказались ошибочными.
Например, бесплатная модель Claude Haiku 4.5, обрабатывая запрос о налогах на пенсии, допустила ошибку, которая могла бы повлечь начисление пенсионному вкладчику сбора в размере £17 500 (примерно $23 430). А Claude изобрел правило, согласно которому выпускник может перестать выплачивать студенческий кредит, если переедет за границу.
Ранее Times.by писал, что ChatGPT встроили в Word: он может создать черновик, отредактировать выделенный текст, исправить ошибки, изменить структуру документа, подготовить резюме.

