В более 50% случаев финансовые советы от ИИ-ботов были неверными – говорят нам последние новости.
Так ли это на самом деле? И что это значит для банков с ИИ-ассистентами? Рассказывает наш директор департамента голосовых цифровых технологий Александр Крушинский:
57% неверных финансовых советов от ChatGPT, Claude и Gemini – цифра громкая, но слегка отличается от оригинала. В отчете 57% – это «неверные или существенно неполные» ответы. Т.е. ответ засчитывался как верный, только если в нем есть абсолютно все нужные цифры, правила, предупреждения и сроки. Если под «неправильно» считать только грубые ошибки (выдуманные правила и устаревшие нормы), то они в сумме дают около 8% всех ответов.
Также, надо понимать, что исследование провела Saturn – британская компания, которая продает ИИ-платформу для финансовых консультантов, и которой выгоден тезис «не доверяйте массовому ИИ, покупайте у нас специальный ИИ».
При этом главный вывод верный: модель без доступа к актуальным нормам вспоминает их по памяти, а многошаговый расчет ведет «в уме». Даже 8% уверенных выдумок для финансовых вопросов – критичная цифра.
Но в решениях Enterprise-уровня никто и не использует просто «ответы LLM». Бизнес-решение отличается от чат-бота обвязкой вокруг модели.
Что делает финансовый ИИ-ответ корректным:
- Знания модель берет из актуальной базы и ссылается на источник. Так закрываются выдуманные и устаревшие правила.
- Все расчеты выполняются через код. Языковая модель разбирает вопрос и вызывает калькулятор.
- Обязательные предупреждения и сроки задаются шаблоном, модель их не выбирает.
- ИИ отвечает только при высокой уверенности. Иначе – диалог переводится на оператора.
- При добавлении новых навыков все ответы вначале проходят через подтверждение специалистом в режиме суфлера и только после этого выводятся напрямую на клиентского ИИ-ассистента.
При соблюдении этих условий риски минимальны. Пример из нашей практики: в банковском боте для клиентов малого бизнеса генеративные ответы по базе знаний поверх сценарного бота закрывают от 60 до 80% вопросов. Качество при этом – 87% верных и полных ответов; доля ответов вводящих в заблуждение – ниже, чем у живых сотрудников.
Генерация и сценарии работают рядом: ИИ берет то, в чем силен, а его слабые места закрывает традиционная автоматизация.
Мы в МАX!
