TGViewer
🇺🇦 Math.random(): community of engineers 🇺🇦 Math.random(): community of engineers @mathrandomcommunity · 1.25K subscribers
Post #987 616
Ти написав скіл для агента. Але як дізнатись, що він працює?

11 вересня Claude Code отримав claude plugin eval: команда проганяє eval-набір плагіна проти самого Claude Code і повертає скорований результат, який можна відтворити. На виході - JSON і HTML-звіт.

⏺ Чому це важливо

Скіл - не код. Це інструкція природною мовою, яку модель виконає трохи інакше сьогодні і зовсім інакше після оновлення. Компілятор її не перевірить. Лінтер теж.

Досі єдиним способом зрозуміти, що скіл працює, було запустити його руками кілька разів. Це не перевірка. Це враження.

⏺ Що класти в eval-набір

Моя думка, не документація. Без цих трьох кейсів набір мало що доводить:

Скіл спрацював - найочевидніший і найменш цінний, майже завжди зелений.

Скіл не спрацював там, де не мав. Скіл, який вмикається не там, гірший за відсутній: з'їдає контекст і збиває агента із задачі.

Межа: формулювання схоже, намір інший. Саме тут скіли розсипаються після зміни моделі.

⏺ Друга половина картини

4 вересня з'явився /skill-doctor: показує, які скіли жодного разу не використовувалися і скільки контексту коштують.

eval → чи працює те, що я підключив
skill-doctor → чи потрібне воно взагалі

Якщо підключено десяток скілів, є ненульовий шанс, що половина просто займає вікно.

⏺ Чесно про межі

Формат набору в changelog не описаний, тільки сама команда - дивись
claude plugin eval --help.


І головне: скорований прогін не робить скіл правильним. Він робить його вимірюваним. Що міряти - вирішуєш ти, і ця частина поки що не автоматизується.

🟡 Changelog: github.com/anthropics/claude-code/releases/tag/v2.1.269

Скільки скілів у тебе зараз підключено?

🔥 - знаю точно і кожен використовую
👀 - треба піти подивитися
  • 👍 8
  • 👀 6
  • 🔥 4
  • ❤ 1
More from @mathrandomcommunity
  1. Sep 30, 2026Подивись, як AI-судді розбирають код агент👆 Це тестова гра нашої команди в ololo. Навіщо…
  2. Sep 30, 2026video post
  3. Sep 29, 2026Найнебезпечніша фраза від AI-агента: «Готово, тести проходять». Мій агент пише її щодня. З…
  4. Sep 29, 2026video post
  5. Sep 24, 2026Нова модель Jev від TypeSafe AI стала однією з найпомітніших новинок останнього тижня 🆕 Я…
  6. Sep 21, 2026Ваш агент платить за генерацію тексту там, де йому потрібна відповідь «так» або «ні». Таке…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →