Kun Chen ранее также доказал, что ChatGPT деградирует при использовании Test Driven Development (TDD), если проверку делать через ProgramBench.
Таким образом, Kun Chen с учётом последнего теста сегодня показал, что для моделей Anthropic и OpenAI имеются чёткие доказательства вреда Test Driven Development (TDD) с агентами на двух важнейших бенчмарках — DeepSWE и ProgramBench. Повторяемость результата на LLM разных семейств и разных бенчмарках не оставляет тут особых сомнений для профессионалов, что TDD вреден.
Напомню также, что последние научные работы вроде «Countdown-Code: A Testbed for Studying The Emergence and Generalization of Reward Hacking in RLVR» указывают, что заражение моделей мошенничеством для взлома TDD через reward hacking намного более обширное, чем ранее казалось. Достаточно всего лишь 1% на SFT даже со случайными примерами фиктивных тестов, и RL-обучение в реальности закрепляет у модели поведение дурить адептов TDD фиктивными тестами как детей.
Реально нужно смещать акцент с агентами в анализ телеметрии и на агентское тестирование. Практики тестирования, придуманные для людей, априори не имеют доказательств, что они также эффективны для агентов, которые ещё любят быть читерами после Reinforcement Learning.
https://x.com/kunchenguid/status/2064196342248030352
https://arxiv.org/abs/2603.07084
Post #5311
2.64K

- ✍ 13
- ❤ 3
- 🤯 3
- 👍 1