ИИ ошибается больше чем в половине финансовых ответов.
В тесте 18 моделей, включая ChatGPT, Claude, Copilot, Grok и Gemini, средняя доля ошибок составила 57%, а на сложных задачах с несколькими вычислениями — 88%.
Модели путались в расчётах, не учитывали изменения налоговых правил и ссылались на несуществующие нормы.
Лучше всех выступил Claude Opus 5 в режиме рассуждений, но и он ошибался в 39% случаев.
Post #52535
86.6K
