Правда ли, что агенты плохо умеют тестировать?
Наткнулся на интересную статью.
Автор прогнал агентов на одной и той же задаче — реализации Zstd на Rust. Это настоящий формат сжатия, где много тонких мест: битовые операции, обратный порядок битов, jump table для нескольких потоков Хаффмана.
Он дал 4 готовых скилла + 26 разных инструкций по тестированию: TDD, QuickCheck, property-based testing, фаззинг, формальные методы. И в итоге почти все техники не сработали. Лучший результат показал вариант без дополнительных инструкций — Default.
Почему могло получиться так?
Если просто написать агенту «используй TDD» или «подключи QuickCheck», он не начинает тестировать лучше. Чаще всего он оборачивает свои обычные слабые тесты в синтаксис названной библиотеки.
Готовые скиллы не помогают, когда они написаны как туториалы. Это должны быть четкие инструкции. А если они еще и большого объема, то нехило тратят токены. Короткий скилл с точными указаниями показал лучший результат среди всех вариантов. Также готовые скиллы бессмысленны без адаптации — их обязательно нужно дорабатывать под конкретную задачу.
Вывод такой: агенты — не плохие тестировщики. Просто они требуют грамотного управления и конкретных указаний.
Post #141
113
- 👍 6
- 🔥 3