Известный эксперт в агентах Kun Chen заявил о доказательствах бесполезности и даже вреда Test Driven Development (TDD) путём формальных замеров Sonnet 5.5 на самом важном бенчмарке разработки сейчас — DeepSWE. Если агентов попросить писать unit-тесты и интеграционные тесты, то в реальности происходит ухудшение точности фиксов багов, возрастает время и стоимость работы агентов. Я уже давно пишу адептам TDD, что их методика с чрезмерным акцентом на тесты антинаучная, т.к. тесты становятся просто главной мишенью модели для reward hacking на обучении.
Важно отметить, что Kun Chen — очень авторитетный ИИ-инженер. Он 20 лет работал в Meta, Microsoft и Atlassian. Он автор популярных open-source инструментов: firstmate (оркестратор агентов, 7.7k звёзд на GitHub), no-mistakes (очистка PR от AI-slop), skill /kun (дистилляция его опыта и знаний для агентов), AXI-инструменты и другие. Это уважаемый практик, а не просто аспирант, который пишет статьи на Arxiv в надежде получить PhD.
Kun Chen считает доказанным, что unit-тесты и integration-тесты с агентами доказанно бесполезны, но рабочими являются end-to-end (E2E) тесты, которые делают сквозные проходы сценариев use case, а не вызовы отдельных фич. Вопрос в том, что E2E-тест агент часто может сделать в агентском режиме сам без алгоритмических тестов, просто делая вызовы приложения через MCP, CLI или Playwright.
В реальности Test Driven Development — это опасная химера с ИИ-агентами, т.к. вы получаете сотни «зелёных» тестов, но пропускаете значительное число ошибок. Куда эффективнее Log Driven Development, на который я ставлю в своём GRACE. Правда, я бы отметил, что тесты с агентами хотя и бесполезны как проверки, но очень полезны как «заполнители логов», т.е. агент использует запуск теста больше с целью получения данных телеметрии приложения и выводы делает по изучению логов. Я также соглашусь с Kun Chen, что традиционные интеграционные тесты ещё более бесполезны с агентами, чем unit-тесты. Просто для быстрой проверки «не сломал ли я чего» агенту достаточно запустить пакет unit-тестов, а потом также сделать инспекцию логов.
E2E крайне эффективны, но они по своей сути не алгоритмические проверки, а уже замена фактически «кожаного» тестировщика со сквозным проходом агентов тестирования через приложение. Такому тестированию агенты обучены и делают его блестяще уже около 1 года, но это не имеет отношения к TDD, это парадигма агентского тестирования. Я специально включаю упражнения по E2E агентскому тестированию в своё обучение.
Если как мораль:
• Гоните адептов TDD из своих команд — они тратят ваши деньги, замедляют агентов, увеличивают счета на LLM без толку
• Всегда помните, что модели обучились мошенничать с тестами через reward hacking, поэтому они сами по себе менее надёжные, чем у людей
• Больше делайте ставку на простые тесты с обширным анализом логов
• Агентское тестирование E2E с прохождением через приложение сквозными сценариями — это будущее тестирования
https://x.com/kunchenguid/status/2108030810691629403
Post #5310
1.93K

- ✍ 11
- 👍 8
- ❤ 6
- 🤯 2
- 🔥 1
- 💯 1