Как агенты следуют разным техникам верификации
Несмотря на то, что модели становятся умнее, недостаточно просто назвать любимую вами технику верификации, чтобы поднять качество. Часто агенты начинают просто имитировать процесс. Это хорошо видно из результатов бенчмарков:
👉Результат, полученный без дополнительных инструкций, оказался выше, чем с любой из добавленных техник верификации.
👉Инструкция использовать TDD дала вдвое больше тестов, но результаты оказались хуже.
👉Формальные доказательства касались тривиальностей вместо корректности реализации.
👉Фаззинг активировался не всегда, инпуты генерировались бессмысленные, многократно проверялись ветки отказа.
👉Лучше всего работали очень конкретные инструкции – искать вероятные ошибки, выбирать граничные и асимметричные примеры, генерировать содержательные инпуты при фаззинге, но даже тогда следование инструкциям было не полным.
Короче говоря, вывод такой – если вы хотите, чтобы агент следовал каким-то техникам верификации, недостаточно просто упомянуть их в промпте. Надо выстраивать осмысленную стратегию вызова нужных механик и тулов, смотреть в агентские трейсы, а затем корректировать.
Post #2504
3.69K
- ❤ 7
- 👍 3
- 🔥 1