Скилы и AGENTS.md в кодинге мало эффективны. Теперь официально!
Недавно вышли два исследования, которые меня очень порадовали.
И вот почему.
Когда у меня раньше спрашивали, чем ты пользуешься в вайб-кодинге. Мне был неловко говорить - в основном, просто хорошо декомпозирую.
Казалось, что как автор паблика про вайб-кодинг, я должен был «держать марку» и всем говорить: MCP, Skills, Subagents, Hooks, SDD, TDD, итд.
Но теперь этого точно не нужно делать, потому что вышли два исследования, которые эмпирическим путем выяснили, что самогенерируемые скилы и инструкции мало эффективны в кодинге.
Помните, я снимал коротенький видосик про использование skills в Antigravity? Так вот, я тогда заметил, что качество дизайна со скилом и без скила, ну не сильно таки лучше.
Я сначала недоумевал: «то ли я дурак, то ли лыжи не едут». Оказалось лыжи не едут.
Вышел SkillsBench - исследование и бенчмарк, который тестирует скилы, как самостоятельный артефакт.
Авторы 15+ топовых универов, взяли 84 задачи из 11 доменов и проверили 3 условия: без скилов, с готовыми скилами и с самостоятельно сгенерированными.
Итого 7308 тректорий тестирования. Итак, какие были результаты?
Готовые скилы в среднем поднимают pass rate на 16,2%, НО! Только там где модели плохо покрыты обучением, например: медицина, промышленность. В разработке ПО, собственно, где мы с вами его чаще всего используем, всего на 4,5%. Что я интуитивно всегда ощущал.
Что интересного заметили в исследовании: самогенерируемые скилы не работают. Моделям предлагали писать гайды, а потом решать задачу, результат упал на 1,3%, по сравнению с работой вообще без скилов.
Нужно перестать использовать скилы? Нет, просто понимать где и когда они дают лучше результаты, а когда лишь тратят наш контекст и сжигают токены.
Следом вышло второе исследование про AGENTS.md
Авторы берут задачи по разработке в открытых репозиториях и смотрят, как кодинг-агенты справляются с ними:
- без AGENTS.md
- с самогенерируемым AGENTS.md
- и написанным разработчиком репозитория.
Вот что выяснилось в ходе исследования:
Сгенерированные контекст‑файлы чаще вредят, чем помогают.
В среднем они немного снижают успех решения задач на 2–3%, при этом повышают стоимость более чем на 20%.
Человеческие контекст‑файлы дают только небольшой плюс.
Прирост качества примерно на +4%, но к стоимости добавляют до 19%.
Теперь мне официально не стыдно говорить, что я почти не использую их, разве что, только чтобы команды для сборки, запуска и миграций хранить.
Значит ли это, что у себя на курсе я больше не буду давать эти инструменты? Нет, буду, но с оговоркой, когда и сколько буста они дают.
Post #468
3.08K
- 👍 21
- 🔥 9
- ❤ 6
- 👏 1