LLM как обычно промолчала и отчиталась об успехе
На прошлой неделе мы перевели одного из наших цифровых сотрудников на новую модель, опус 5.5 (дешевле на 20% и на мой взгляд лучше работает с моим задачами). Запустили тесты перед обновлением. Первый сбой был явный. Новая модель отказывалась отвечать, если ей не включали режим размышлений, и прямо писала об этом в ошибке. Мы откатились на прежнюю версию, опус 4.8
Можно ли возвращать новую модель, если размышления просто включить? Мы отдельно проверили на настоящей работе. Другой ИИ-агент взял шесть недавних рабочих запросов, которые цифровой сотрудник уже выполнил на старой модели, и прогнал каждый через новую дважды, в разных режимах размышлений
Пять запросов из шести прошли. Шестой оба раза вернулся пустым, хотя формально всё было в порядке. Сервер ответил «успешно», в ответе ноль символов, а причина указана в служебном поле. Сработал встроенный фильтр модели, который должен отсекать недопустимые темы
Что за текст так не понравился фильтру? Рабочая сводка про просроченные, ничейные и зависшие задачи, которую цифровой сотрудник сам же и составил. Обычный документ для своих процессов, не клиентский и не личный 🤷
Явную ошибку видно сразу, а вторая маскируется под успех. В тысячный раз: доверяй, но проверяй. Перед обновлением модели всегда следует прогонять заранее заготовленные тесты, проверяющие не только корректность работы, но бизнесовую и продуктовую логику
Цена вопроса перед тем, как выпускать обновлённую модель к пользователям (в моём случае), — меньше 5 долларов на тесты, 5 минут времени и 0 разочарованных пользователей
Post #219
67
- ❤ 4
- 🔥 2
- 🤯 2