TGViewer
Книжный куб Книжный куб @book_cube · 15.7K subscribers
Post #4752 2.95K
Philipp Schmid про agent skills: сначала eval, потом публикация (Рубрика #AI4SDLC)

Посмотрел короткое выступление Philipp Schmid из Google DeepMind «Don't Ship Skills Without Evals» . Главный тезис простой: skill меняет поведение агента, поэтому выпускать его без проверки - примерно как менять код без тестов.

Schmid предлагает проверять не то, прочитал ли агент SKILL.md, а итог работы. Для этого каждому skill нужен небольшой набор задач: где он должен подключиться, где не должен и какой результат считается правильным. Сначала хватит обычных проверок через скрипты и регулярные выражения; LLM-as-a-judge нужен только там, где результат нельзя проверить детерминированно.

Вот как примерно выглядит алгоритм автора, который можно забрать себе

1. Выбрать один часто используемый skill.
2. Написать пять тестовых запросов: позитивные, негативные и один реальный проблемный кейс.
3. Для каждого задать проверяемый результат, а не обязательную последовательность действий агента.
4. Несколько раз прогнать задачи со skill и без него в изолированном окружении.
5. Удалить no-op инструкции. Если skill не улучшает результат — удалить и его, а eval оставить для регрессии.

Дальше этот набор стоит расширить до 10–20 кейсов и запускать при каждом изменении skill и обновлении модели.

Итого, SKILL.md - это не документация «на всякий случай», а часть агентной системы. Его ценность определяется не объемом инструкций, а измеримым изменением результата.

#AI #AI4SDLC #Agents #Evals #Engineering
YouTube Don't Ship Skills Without Evals — Philipp Schmid, Google DeepMind There are thousands of agent skills. Almost none of them are tested. They get vibe-checked with two manual runs, maybe a thumbs-up from a colleague, then shipped. You wouldn't merge code without tests — so why are we shipping skills without evals? This talk…
  • ❤ 15
  • 👍 7
  • 🔥 1
  • 🥴 1
More from @book_cube
  1. Oct 4, 2026Один дизайнер и сотни материалов (Рубрика #AI) В этом видео «One Designer + AI. Hundreds o…
  2. Oct 4, 20263 AImigo S1E8: AI-native компания — материалы выпуска (Рубрика #AI4SDLC) Собрал материалы…
  3. Oct 4, 2026В процессе подготовки к переезду начал разбирать книжки и освобождать свою библиотеку. Нат…
  4. Oct 4, 2026Stanford CME295, лекция 1: как текст становится вычислениями (Рубрика #AI) Первая лекция к…
  5. Oct 3, 2026Камил видит руками (Рубрика #ForKids) Читаю своему пятилетнему сыну Кириллу перед сном эту…
  6. Oct 3, 2026Где деньги в своих данных: цены, клиенты, ассортимент — материалы второго выпуска (Рубрика…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →