TGViewer
❝[Консенсус Тьюринга]❞ ❝[Консенсус Тьюринга]❞ @turing_consensus · 704 subscribers
Post #1013 31
💵 ИИ всё ещё не умеет считать деньги: 57% ошибок

Британский финтех Saturn прогнал 18 моделей (ChatGPT, Claude, Gemini, Grok, Copilot) через 121 денежный вопрос — долги, ипотека, пенсии, налоги.
Каждый задавали до пяти раз, вышло совокупно больше 10 000 ответов. Провалом считали не только прямую ошибку в цифрах, но и пропуск обязательной оговорки о рисках — то есть мерили строго, как работу лицензированного консультанта.

Вопросы были из реальной жизни: какой долг гасить первым, можно ли перестать платить студенческий кредит после переезда за границу, сколько внести в пенсию чтобы не попасть на лишний налог, стоит ли досрочно закрывать ипотеку и т.д.

Результат: в среднем 57% ответов — мимо. На сложных многошаговых задачах с налоговыми правилами — 88% ошибок. То есть если по-человечески, точность 12%.


🔖 Кто во что горазд

⚫️Лучший — Claude Opus 5 в режиме рассуждений: 39% ошибок.
⚫️Дальше ChatGPT — 58%, Grok — 59%, Gemini Pro — 73%.
⚫️Худший — Claude Haiku 4.5, младшая бесплатная модель: 82%.

На самых трудных вопросах Gemini Flash и Haiku промахивались в 99% случаев. В целом же бесплатные модели врут чаще платных (63% ошибок против 49%).

39% ошибок у флагмана — это на самом деле не «почти хорошо». Это две ошибки из пяти в вопросах про деньги (про деньги, Карл 🧐). В любой другой профессии за такое отбирают лицензию.

❗️ Штраф £17 500

Та самая цифра из новостных заголовков.
Один из советов в тесте гипотетически стоил бы человеку налогового штрафа в £17 500: модель напутала в британских правилах пенсионных взносов.
Ошибся, конечно, не Opus 5, а Haiku 4.5 (это тот у которого 82% промахов) — но хрен редьки, как говорится...😝

🚫 А судьи кто

Тут стоит немного сбавить пафос. Saturn — не независимая лаборатория, а компания, которая продаёт ИИ-инструменты живым финансовым консультантам и агитирует за регулирование ботов-аналитиков.

Исследование удобно защищает её бизнес. Критик Стив Конли из Academy of Life Planning добавляет: ключ ответов закрыт (все вопросы и формулировки промптов не показали), да и с людьми результат не сравнивали — вдруг живые консультанты ошибаются не реже (факт🤔).

Но даже если сделать скидку на то, что заказчик исследования сам заинтересован в таком выводе, 39% ошибок у лучшей модели говорят сами за себя.

Тем временем, криптомедиа уже всерьёз печатают прогнозы цен от ботов: по $XRP модели разошлись от $0,85 у Claude до 🐂бычьих $3–4 у Gemini. Согласия между ними нет от слова «совсем».

• • • • • • • • • •

❗️ Сейчас будет МОРАЛЬ:
Бот — не калькулятор и тем более не советник. (вот это поворот😂)


Опаснее всего то, что он уверенно выдумывает несуществующие правила: в тесте Claude на голубом глазу сообщил, что студенческий кредит можно перестать платить, просто переехав за границу (спойлер, это неправда).
Так что любую цифру и любое «правило» от бота следует по-прежнему проверять по первоисточнику (к счастью, это можно делать не руками) — особенно когда на кону твои 💰.

❝[Консенсус Тьюринга]❞ | 💬 Чат | 🔄 Проверенная обменка
  • 👍 1
More from @turing_consensus
  1. Sep 25, 2026🤖 Зачем OpenAI и Anthropic вдруг захотели притормозить ИИ — версия Артура Хейса Артур Хей…
  2. Sep 23, 2026🪙 Легальная крипта в России: сколько стоит вход в белую зону До конца года в РФ должен за…
  3. Sep 22, 2026💵 Apple и Google ищут людей под стейблкоины Крипто-каналы преподносят это как «стейблы за…
  4. Sep 21, 2026💀 Как $848 тысяч убили проект с $12 млн от a16z 19 сентября команда Linera (не путаем с L…
  5. Sep 21, 2026⌛ Дайджест недели · 14–20 сентября Все посты недели — коротко. На случай, если что-то проп…
  6. Sep 20, 2026🧠 JEV: ИИ, который не пишет текст, а называет вероятности 15 сентября из стелса вышла Typ…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →