ИИ написал больше тестов и не стал ловить больше ошибок
Если проверять четыре потока на одинаковых данных, их можно перепутать местами, а тест всё равно доволен. Именно такие проверки встретились в эксперименте Дэна Лу.
Codex с GPT-5.6 Sol писал декодер Zstd на Rust. Простое требование использовать методику тестирования часто приводило к поверхностным проверкам. Вывод относится к этой модели и задаче.
В новости разбираем, как проверяли агента, где тесты обходили проблемную логику и на что смотреть в следующем ревью, кроме зелёных галочек.
Post #10684
812

- 👍 3