🧑💻 Потестил разных агентов на ваншотных промптах
Вчера осознал, что у меня есть три активных подписки на агентов:
Windsurf (GPT-5-medium)
Claude (Sonnet 4)
Zencoder (не известно какая там моделька, но говорят, что GPT-5)
И решил попробовать запилить быстрый тест качества решения задач и заодно понять, улучшает ли просьба написать тесты качество задач.
1️⃣ Сделал тестовую репу с АПИшкой для аренды книг:
https://github.com/Undermove/agents-benchmark-repository
2️⃣ Придумал два промпта, в которых прошу реализовать фичу e-mail нотификаций по почте. В одном промпте просил просто реализовать фичу, а во втором все тоже самое + просил написать e2e тесты на каждую из фич. Промпты в комментах
3️⃣ Оценивал результат так: если проект компилится, тесты которые написал сам агент проходят, а код примерно похож на то что нужно, то агент справился, если нет, то не справился. Получился вот такой результат:
И еще Женя Васильев наш EM опробовал Github Copilot и Виталик Помозов наш мегатехлид попробовал Codex в этом тесте, так что они тоже есть в подборке
Промпт 1 без просьбы написать тесты:
Zencoder
✅ Компилится
✅ Тесты проходят
✅ Код похож
Windsurf
✅ Компилится
✅ Тесты проходят
✅ Код похож
Claude
❌ Компилится
❌ Тесты проходят
✅ Код похож
Github Copilot
❌ Компилится
❌ Тесты проходят
✅ Код похож
Codex
✅ Компилится
✅ Тесты проходят
❌ ✅ Код похож - но нигде не вызывается
Промпт 2 с просьбой написать тесты:
Zencoder
✅ Компилится
✅ Тесты проходят
✅ Код похож
Windsurf
❌ Компилится
❌ Тесты проходят
❌ Код похож
Claude
✅ Компилится
✅ Тесты проходят
✅ Код похож
Github Copilot
✅ Компилится
❌ Тесты проходят
✅ Код похож
Codex
✅ Компилится
❌ Тесты проходят
✅ Код похож
Пока что вывод такой: качество кода скорее зависит от агента, чем от того, попросите вы его написать тесты или нет.
🏆 Github Copilot чисто по количсетву галочек самый туповатый. По словам Жени когда он увидел, что тесты упали, сказал: “Отлично! Тесты прошли!” ☺️ Заслуженная победа в общем. (А ну и виндсерф не отстает)
В репозитории в пулреквестах можно посмотреть, что там агенты сделали. Ну и если не лень, то можно попытаться позапускать у себя.
PS> Если у вас есть какие-то еще подписки на которых вы можете прогнать тестово эти промпты, то поделитесь в комментах, было бы интересно посмотреть, что получится)
Ну и пулрек можете сделать, чтобы он тоже в списке светился
И если есть идеи, как можно тест подулучшить, то тоже пишите ✏️
У меня у самого в планах:
🟢 Попробовать написать e2e тесты, которые будут проверять результат и по ним тоже делать зачет. Но нужно чтобы агент эти тесты не видел во время выполнения задач.
🟢 Попробовать позапускать несколько раз один и тот же промпт и попробовать собрать статистику, как часто на одном и том же промпте агенту везло/не везло. Вдруг зенкодер просто фартовый?
🟢 Попробовать дать математическую задачку. К примеру нужно посчитать среднее/медиану/статистику. Может аналитику прикрутить попросить? Говорят, что с математикой агенты не дружат
🟢 Попробовать разные модели на одних и тех же агентах, к примеру на виндсерфе прогнать соннет вместо GPT
Post #347
1.27K