TGViewer
Вайб-кодинг по Чуйкову | Ментор Вайб-кодинг по Чуйкову | Ментор @vibe_coding · 6.78K subscribers
Post #468 3.08K
Скилы и AGENTS.md в кодинге мало эффективны. Теперь официально!

Недавно вышли два исследования, которые меня очень порадовали.

И вот почему.

Когда у меня раньше спрашивали, чем ты пользуешься в вайб-кодинге. Мне был неловко говорить - в основном, просто хорошо декомпозирую.

Казалось, что как автор паблика про вайб-кодинг, я должен был «держать марку» и всем говорить: MCP, Skills, Subagents, Hooks, SDD, TDD, итд.

Но теперь этого точно не нужно делать, потому что вышли два исследования, которые эмпирическим путем выяснили, что самогенерируемые скилы и инструкции мало эффективны в кодинге.

Помните, я снимал коротенький видосик про использование skills в Antigravity? Так вот, я тогда заметил, что качество дизайна со скилом и без скила, ну не сильно таки лучше.

Я сначала недоумевал: «то ли я дурак, то ли лыжи не едут». Оказалось лыжи не едут.

Вышел SkillsBench - исследование и бенчмарк, который тестирует скилы, как самостоятельный артефакт.

Авторы 15+ топовых универов, взяли 84 задачи из 11 доменов и проверили 3 условия: без скилов, с готовыми скилами и с самостоятельно сгенерированными.

Итого 7308 тректорий тестирования. Итак, какие были результаты?

Готовые скилы в среднем поднимают pass rate на 16,2%, НО! Только там где модели плохо покрыты обучением, например: медицина, промышленность. В разработке ПО, собственно, где мы с вами его чаще всего используем, всего на 4,5%. Что я интуитивно всегда ощущал.

Что интересного заметили в исследовании: самогенерируемые скилы не работают. Моделям предлагали писать гайды, а потом решать задачу, результат упал на 1,3%, по сравнению с работой вообще без скилов.

Нужно перестать использовать скилы? Нет, просто понимать где и когда они дают лучше результаты, а когда лишь тратят наш контекст и сжигают токены.

Следом вышло второе исследование про AGENTS.md

Авторы берут задачи по разработке в открытых репозиториях и смотрят, как кодинг-агенты справляются с ними:
- без AGENTS.md
- с самогенерируемым AGENTS.md
- и написанным разработчиком репозитория.

Вот что выяснилось в ходе исследования:

Сгенерированные контекст‑файлы чаще вредят, чем помогают.

В среднем они немного снижают успех решения задач на 2–3%, при этом повышают стоимость более чем на 20%.

Человеческие контекст‑файлы дают только небольшой плюс.

Прирост качества примерно на +4%, но к стоимости добавляют до 19%.

Теперь мне официально не стыдно говорить, что я почти не использую их, разве что, только чтобы команды для сборки, запуска и миграций хранить.

Значит ли это, что у себя на курсе я больше не буду давать эти инструменты? Нет, буду, но с оговоркой, когда и сколько буста они дают.
  • 👍 21
  • 🔥 9
  • ❤ 6
  • 👏 1
More from @vibe_coding
  1. Sep 21, 2026Две бесплатные открытые альтернативы Grok Bot Я тут кайфанул от нового юзер экспириенса ра…
  2. Sep 20, 2026За 1 день закончились недельные лимиты в Codex за 200$, доплатил кредитами 20$, хватило на…
  3. Sep 16, 2026Нашел +1 причину перейти на терминальный Claude Code с десктопного. Оказывается десктоп ве…
  4. Sep 14, 2026Делюсь полезными халявными находками! Нашел дешевые +1 номера, сработало подтверждение ном…
  5. Sep 10, 2026Ребят, я тут планирую интеграцию Lovarus внешними CRM. Какие сейчас в РФ рынке в топе, что…
  6. Sep 10, 2026Тестирую новую Image модель от OpenAI. Они и раньше были крутыми. Не чувствую сильно уже р…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →