11 вересня Claude Code отримав claude plugin eval: команда проганяє eval-набір плагіна проти самого Claude Code і повертає скорований результат, який можна відтворити. На виході - JSON і HTML-звіт.
⏺ Чому це важливо
Скіл - не код. Це інструкція природною мовою, яку модель виконає трохи інакше сьогодні і зовсім інакше після оновлення. Компілятор її не перевірить. Лінтер теж.
Досі єдиним способом зрозуміти, що скіл працює, було запустити його руками кілька разів. Це не перевірка. Це враження.
⏺ Що класти в eval-набір
Моя думка, не документація. Без цих трьох кейсів набір мало що доводить:
Скіл спрацював - найочевидніший і найменш цінний, майже завжди зелений.
Скіл не спрацював там, де не мав. Скіл, який вмикається не там, гірший за відсутній: з'їдає контекст і збиває агента із задачі.
Межа: формулювання схоже, намір інший. Саме тут скіли розсипаються після зміни моделі.
⏺ Друга половина картини
4 вересня з'явився /skill-doctor: показує, які скіли жодного разу не використовувалися і скільки контексту коштують.
eval → чи працює те, що я підключив
skill-doctor → чи потрібне воно взагалі
Якщо підключено десяток скілів, є ненульовий шанс, що половина просто займає вікно.
⏺ Чесно про межі
Формат набору в changelog не описаний, тільки сама команда - дивись
claude plugin eval --help.
І головне: скорований прогін не робить скіл правильним. Він робить його вимірюваним. Що міряти - вирішуєш ти, і ця частина поки що не автоматизується.
🟡 Changelog: github.com/anthropics/claude-code/releases/tag/v2.1.269
Скільки скілів у тебе зараз підключено?
🔥 - знаю точно і кожен використовую
👀 - треба піти подивитися