Британский финтех Saturn прогнал 18 моделей (ChatGPT, Claude, Gemini, Grok, Copilot) через 121 денежный вопрос — долги, ипотека, пенсии, налоги.
Каждый задавали до пяти раз, вышло совокупно больше 10 000 ответов. Провалом считали не только прямую ошибку в цифрах, но и пропуск обязательной оговорки о рисках — то есть мерили строго, как работу лицензированного консультанта.
Вопросы были из реальной жизни: какой долг гасить первым, можно ли перестать платить студенческий кредит после переезда за границу, сколько внести в пенсию чтобы не попасть на лишний налог, стоит ли досрочно закрывать ипотеку и т.д.
Результат: в среднем 57% ответов — мимо. На сложных многошаговых задачах с налоговыми правилами — 88% ошибок. То есть если по-человечески, точность 12%.
🔖 Кто во что горазд
⚫️Лучший — Claude Opus 5 в режиме рассуждений: 39% ошибок.
⚫️Дальше ChatGPT — 58%, Grok — 59%, Gemini Pro — 73%.
⚫️Худший — Claude Haiku 4.5, младшая бесплатная модель: 82%.
На самых трудных вопросах Gemini Flash и Haiku промахивались в 99% случаев. В целом же бесплатные модели врут чаще платных (63% ошибок против 49%).
39% ошибок у флагмана — это на самом деле не «почти хорошо». Это две ошибки из пяти в вопросах про деньги (про деньги, Карл 🧐). В любой другой профессии за такое отбирают лицензию.
❗️ Штраф £17 500
Та самая цифра из новостных заголовков.
Один из советов в тесте гипотетически стоил бы человеку налогового штрафа в £17 500: модель напутала в британских правилах пенсионных взносов.
Ошибся, конечно, не Opus 5, а Haiku 4.5 (это тот у которого 82% промахов) — но хрен редьки, как говорится...😝
🚫 А судьи кто
Тут стоит немного сбавить пафос. Saturn — не независимая лаборатория, а компания, которая продаёт ИИ-инструменты живым финансовым консультантам и агитирует за регулирование ботов-аналитиков.
Исследование удобно защищает её бизнес. Критик Стив Конли из Academy of Life Planning добавляет: ключ ответов закрыт (все вопросы и формулировки промптов не показали), да и с людьми результат не сравнивали — вдруг живые консультанты ошибаются не реже (факт🤔).
Но даже если сделать скидку на то, что заказчик исследования сам заинтересован в таком выводе, 39% ошибок у лучшей модели говорят сами за себя.
Тем временем, криптомедиа уже всерьёз печатают прогнозы цен от ботов: по $XRP модели разошлись от $0,85 у Claude до 🐂бычьих $3–4 у Gemini. Согласия между ними нет от слова «совсем».
• • • • • • • • • •
❗️ Сейчас будет МОРАЛЬ:
Бот — не калькулятор и тем более не советник. (вот это поворот😂)
Опаснее всего то, что он уверенно выдумывает несуществующие правила: в тесте Claude на голубом глазу сообщил, что студенческий кредит можно перестать платить, просто переехав за границу (спойлер, это неправда).
Так что любую цифру и любое «правило» от бота следует по-прежнему проверять по первоисточнику (к счастью, это можно делать не руками) — особенно когда на кону твои 💰.
❝[Консенсус Тьюринга]❞ | 💬 Чат | 🔄 Проверенная обменка
