Как часто ИИ врет и ошибается в финансовых советах

Обновлено:
Фото: pch.vector, Magnific.com

Фото: pch.vector, Magnific.com

Компания Saturn протестировала ChatGPT, Claude, Copilot, Grok и Gemini по финансовым вопросам.

Добавить в основные
источники Google

Популярные чат-боты часто дают неправильные ответы на финансовые вопросы, следует из результатов исследования, проведенного компанией Saturn.

ChatGPT, Claude, Copilot, Grok и Gemini давали ошибочные советы в среднем в 57% случаев, если запрос был сложнее и требовал нескольких расчетов – количество ошибок возрастало до 88%.

В ходе исследования было проверено более 100 различных вопросов, связанных с деньгами, – и на платных, и на бесплатных версиях. В целом 18 моделей получили более 10 000 запросов, причем каждый вопрос могли повторять до пяти раз.

ИИ-модели ошибались в финансовых расчетах, игнорировали грядущие изменения налогового законодательства, использовали выдуманные правила и давали неправильные ответы на сложные запросы, требовавшие нескольких вычислений.

Некоторе модели при сложных вопросах ошибались в 99% случаев. Лучший результат был у Claude Opus 5 в режиме «рассуждения», однако даже у этой модели 39% ответов оказались ошибочными.

Например, бесплатная модель Claude Haiku 4.5, обрабатывая запрос о налогах на пенсии, допустила ошибку, которая могла бы повлечь начисление пенсионному вкладчику сбора в размере £17 500 (примерно $23 430). А Claude изобрел правило, согласно которому выпускник может перестать выплачивать студенческий кредит, если переедет за границу.

Ранее Times.by писал, что ChatGPT встроили в Word: он может создать черновик, отредактировать выделенный текст, исправить ошибки, изменить структуру документа, подготовить резюме.