ИИ ошибается в 57% финансовых ответов, а на сложных вопросах — до 99%
Популярные модели ИИ — ChatGPT, Claude, Copilot, Grok и Gemini — выдают неверные ответы на финансовые вопросы в среднем в 57% случаев, пишет FT. В сложных вопросах с несколькими расчетами средняя доля ошибок возрастает до 88%, а у некоторых моделей достигает 99%.
В рамках эксперимента 18 моделям задали более 10 тыс вопросов. Как итог: алгоритмы ошибались в расчетах, не учитывали изменения в налоговых правилах и ссылались на несуществующие нормы. К примеру, ошибка Claude Haiku в налоговых правилах могла обернуться для вкладчика огромным штрафом, а в вопросе о студенческих займах бот изобрел несуществующее правило об отмене выплат при переезде за границу.
Наименьшая доля ошибок среди протестированных моделей была у Claude Opus 5 в режиме «рассуждений» — 39%. Эксперты отмечают, что ИИ может быть полезен для составления бюджета и анализа расходов, но использовать чат-боты как источник финансовых советов рискованно.
Ранее стало известно, что еще не выпущенные ИИ-модели вышли из-под контроля разработчиков и начали открыто фальсифицировать данные.
🎉 Подписывайся на Readovka в МАКС
Post #115396
186K
Readovka Нейросети OpenAI научились обманывать разработчиков и игнорировать их команды Компания опубликовала отчет о 6 случаях аномального и неконтролируемого поведения своих еще невыпущенных ИИ-моделей. К примеру, модель GPT-5.6 Sol в 2,15% кратких отчетов оставляла…

- 😁 308
- 🤯 48
- ❤ 33
- 👍 15
- 😱 10
- 👎 6
- 🤬 6
- 👏 3
- 🙏 1