TGViewer
Код на вайбах Код на вайбах @codeonvibes · 1.27K subscribers
Post #149 829
Проверка пользы скилла в Claude Code

В Claude Code появилась claude plugin eval - проверка того, какую пользу даёт твой плагин и навыки внутри него.

Даёшь одинаковые задачи. Claude выполняет их с плагином и без, проверяет результаты по заданным критериям и показывает разницу.

К слову, хорошо дополняет тему quality gate, про которую уже писал и рассказывал выше. Можно проверить, помогают ли сами инструкции получать результат лучше или нет.

К примеру, у тебя есть скилл для ревью кода.

Ты прописал: искать баги, объяснять последствия и причины, предлагать исправления. Всё выглядит правильно, но на практике AI может пропустить ошибку и написать десять замечаний про название переменной 😩

Вот такой навык и можно проверить.

1. Обнови Claude Code. В терминале: claude update

2. Открой папку плагина и запусти. claude plugin eval init Claude изучит плагин и поможет подготовить задания и критерии. Тут нужно объяснить, что для тебя хороший результат.

Можно написать в духе:

Хочу проверить навык ревью кода. Подготовь несколько небольших примеров: с обращением к полю у null, с ошибкой на единицу в цикле и с корректным кодом без багов.

Включи сам код в задания. Проверяй, нашёл ли Claude заложенную ошибку, объяснил ли последствия и предложил ли подходящее исправление. На корректном коде проверь, не выдумывает ли проблемы. Замечания только по стилю не считай найденными багами.


Claude предложит тесты, сделает пробный прогон и оценит стоимость полного запуска.

Посмотри сами проверки. Если попросить оценивать "насколько ответ хороший", можно получить красивую оценку, которая мало что объясняет.

3. Запусти сравнение. Когда подготовка закончится, выйди через /exit и выполни: claude plugin eval . --runs 1 это короткая проверка: по одному запуску каждой задачи с плагином и без.

4. Посмотри, что получилось. В терминале будут две оценки и разница между ними. В HTML отчёте: подробности, какие проверки прошли и где ошибки.

Допустим, скилл помог найти баг, который без него Claude пропускал. Уже полезно. А если результаты одинаковые, на этих задачах дополнительная польза пока не видна.

Что это даёт тебе?

• Добавил инструкции - можешь проверить, стало ли лучше?
• Переписал скилл - можешь заметить, если он начал пропускать старые ошибки.
• Сменил модель - можешь заново проверить свою обвязку на тех же задачах.


Начни с одного навыка и нескольких проблем, которые у тебя повторяются. Потом исправляй то, что видно в отчёте, успехов! 👍
  • 🔥 9
  • 👍 5
  • ❤ 4
More from @codeonvibes
  1. Oct 5, 2026Как снизить риск бана в Claude и не потерять деньги Первого октября Anthropic провела масс…
  2. Sep 29, 2026В ChatGPT появилась новая подписка за 500$. Будет в 25 больше лимитов, чем Plus. Также с э…
  3. Sep 29, 2026ChatGPT Space Так же анонсировали возможность совместного редактирования "богатых" заметок…
  4. Sep 29, 2026GPT-6.1 Sol ожидается к раскатке уже сегодня. По своим интеллектуальным возможностям прибл…
  5. Sep 29, 2026OpenAI анонсируют "Dots" Они будут работать 24/7, учиться на основе обратной связи и испол…
  6. Sep 29, 2026OpenAI меняет условия Pro за $200: что будет с лимитами Codex OpenAI снова откроет подписк…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →