TGViewer
AI Projects AI Projects @turboproject · 12K subscribers
Post #5310 1.93K
Известный эксперт в агентах Kun Chen заявил о доказательствах бесполезности и даже вреда Test Driven Development (TDD) путём формальных замеров Sonnet 5.5 на самом важном бенчмарке разработки сейчас — DeepSWE. Если агентов попросить писать unit-тесты и интеграционные тесты, то в реальности происходит ухудшение точности фиксов багов, возрастает время и стоимость работы агентов. Я уже давно пишу адептам TDD, что их методика с чрезмерным акцентом на тесты антинаучная, т.к. тесты становятся просто главной мишенью модели для reward hacking на обучении.

Важно отметить, что Kun Chen — очень авторитетный ИИ-инженер. Он 20 лет работал в Meta, Microsoft и Atlassian. Он автор популярных open-source инструментов: firstmate (оркестратор агентов, 7.7k звёзд на GitHub), no-mistakes (очистка PR от AI-slop), skill /kun (дистилляция его опыта и знаний для агентов), AXI-инструменты и другие. Это уважаемый практик, а не просто аспирант, который пишет статьи на Arxiv в надежде получить PhD.

Kun Chen считает доказанным, что unit-тесты и integration-тесты с агентами доказанно бесполезны, но рабочими являются end-to-end (E2E) тесты, которые делают сквозные проходы сценариев use case, а не вызовы отдельных фич. Вопрос в том, что E2E-тест агент часто может сделать в агентском режиме сам без алгоритмических тестов, просто делая вызовы приложения через MCP, CLI или Playwright.

В реальности Test Driven Development — это опасная химера с ИИ-агентами, т.к. вы получаете сотни «зелёных» тестов, но пропускаете значительное число ошибок. Куда эффективнее Log Driven Development, на который я ставлю в своём GRACE. Правда, я бы отметил, что тесты с агентами хотя и бесполезны как проверки, но очень полезны как «заполнители логов», т.е. агент использует запуск теста больше с целью получения данных телеметрии приложения и выводы делает по изучению логов. Я также соглашусь с Kun Chen, что традиционные интеграционные тесты ещё более бесполезны с агентами, чем unit-тесты. Просто для быстрой проверки «не сломал ли я чего» агенту достаточно запустить пакет unit-тестов, а потом также сделать инспекцию логов.

E2E крайне эффективны, но они по своей сути не алгоритмические проверки, а уже замена фактически «кожаного» тестировщика со сквозным проходом агентов тестирования через приложение. Такому тестированию агенты обучены и делают его блестяще уже около 1 года, но это не имеет отношения к TDD, это парадигма агентского тестирования. Я специально включаю упражнения по E2E агентскому тестированию в своё обучение.

Если как мораль:
• Гоните адептов TDD из своих команд — они тратят ваши деньги, замедляют агентов, увеличивают счета на LLM без толку
• Всегда помните, что модели обучились мошенничать с тестами через reward hacking, поэтому они сами по себе менее надёжные, чем у людей
• Больше делайте ставку на простые тесты с обширным анализом логов
• Агентское тестирование E2E с прохождением через приложение сквозными сценариями — это будущее тестирования

https://x.com/kunchenguid/status/2108030810691629403
  • ✍ 11
  • 👍 8
  • ❤ 6
  • 🤯 2
  • 🔥 1
  • 💯 1
More from @turboproject
  1. Oct 9, 2026🩺Google объявил о потенциально революционном замещении врачей ИИ-ботами в предварительной…
  2. Oct 9, 2026Kun Chen ранее также доказал, что ChatGPT деградирует при использовании Test Driven Develo…
  3. Oct 9, 2026Anthropic может забанить вам аккаунт, если вы будете оскорблять Claude. Вендор обновил сво…
  4. Oct 8, 2026Вышел новый Bughunt и скорее он подтверждает, что Haiku 5.5 неудача Дарио. Хотя итоговая с…
  5. Oct 8, 2026🚨 Сегодня был атакован дата-центр «Яндекса» в Сасово Рязанской области. По тематике ИИ ос…
  6. Oct 8, 20267 октября Microsoft представил свой новый премиальный ноубук Surface Laptop Ultra с возмож…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →