В Claude Code появилась claude plugin eval - проверка того, какую пользу даёт твой плагин и навыки внутри него.
Даёшь одинаковые задачи. Claude выполняет их с плагином и без, проверяет результаты по заданным критериям и показывает разницу.
К слову, хорошо дополняет тему quality gate, про которую уже писал и рассказывал выше. Можно проверить, помогают ли сами инструкции получать результат лучше или нет.
К примеру, у тебя есть скилл для ревью кода.
Ты прописал: искать баги, объяснять последствия и причины, предлагать исправления. Всё выглядит правильно, но на практике AI может пропустить ошибку и написать десять замечаний про название переменной 😩
Вот такой навык и можно проверить.
1. Обнови Claude Code. В терминале:
claude update2. Открой папку плагина и запусти.
claude plugin eval init Claude изучит плагин и поможет подготовить задания и критерии. Тут нужно объяснить, что для тебя хороший результат.Можно написать в духе:
Хочу проверить навык ревью кода. Подготовь несколько небольших примеров: с обращением к полю у null, с ошибкой на единицу в цикле и с корректным кодом без багов.
Включи сам код в задания. Проверяй, нашёл ли Claude заложенную ошибку, объяснил ли последствия и предложил ли подходящее исправление. На корректном коде проверь, не выдумывает ли проблемы. Замечания только по стилю не считай найденными багами.
Claude предложит тесты, сделает пробный прогон и оценит стоимость полного запуска.
Посмотри сами проверки. Если попросить оценивать "насколько ответ хороший", можно получить красивую оценку, которая мало что объясняет.
3. Запусти сравнение. Когда подготовка закончится, выйди через /exit и выполни:
claude plugin eval . --runs 1 это короткая проверка: по одному запуску каждой задачи с плагином и без.4. Посмотри, что получилось. В терминале будут две оценки и разница между ними. В HTML отчёте: подробности, какие проверки прошли и где ошибки.
Допустим, скилл помог найти баг, который без него Claude пропускал. Уже полезно. А если результаты одинаковые, на этих задачах дополнительная польза пока не видна.
Что это даёт тебе?
• Добавил инструкции - можешь проверить, стало ли лучше?
• Переписал скилл - можешь заметить, если он начал пропускать старые ошибки.
• Сменил модель - можешь заново проверить свою обвязку на тех же задачах.
Начни с одного навыка и нескольких проблем, которые у тебя повторяются. Потом исправляй то, что видно в отчёте, успехов! 👍
