TGViewer
VanillaTime VanillaTime @vanillatime · 1.91K subscribers
Post #1072 358
Вчера я прожёг все лимиты токенов во всех моделях: Gemini ушёл отдыхать на день, а с Claude’ом мы увидимся снова только через месяц. Куда можно было угрохать столько бюджета? 😦

Может, я генерил тяжеловесные видосы и картинки? Нет.
Может, кодил огромные проекты? Тоже нет, кодил совсем чуть-чуть. Топка, в которой сгорели все токены — это мой изолированный эксперимент.

Сейчас я готовлю доклад на конференцию о пользе оптимизации скиллов (тех самых SKILL.md). Чтобы не быть голословным, решил подтвердить теорию цифрами и провести эксперимент в управляемой среде: сравнить результаты обычного one-shot промпта, базового скилла и оптимизированного. Звучит просто, да? Я тоже так думал. 😅

😯 Во-первых, в природе нет готовых сред для корректного сравнения именно скиллов. Промпты — пожалуйста, хоть в параллели запускай. А вот сложные скиллы — увы и ах, извольте ручками. Пришлось пилить кастомный стенд на базе agy (CLI Antigravity от Google), благо он такое могёт.

👀Во-вторых, отсматривать глазками результаты по 50 дизайн-системам — занятие неэффективное. Поэтому я выбрал путь истинной боли и страданий собрать пайплайн LLM as a Judge (больше о концепции написано у MindStudio).

Суть концепции: после каждого рана скилла более дешевая модель выступает судьей, оценивает качество и ищет брак. И если вы верите в сказки, что современные модели «сами всё понимают» — у меня для вас сюрприз. На одном голом промпте ваш судья уедет не туда. Ему нужно подготовить жесткие критерии (рубрики) оценки под каждый сценарий, дать expected output для сверки, а еще детально объяснить: что такое хорошо, что такое плохо, на что закрывать глаза, а за что карать. 🧑‍⚖️

Но даже несмотря на все преграды в виде «слишком умного» Gemini, который почему-то всегда выбирал использовать «самому продвинутый скилл, блокировки автоматических ранов и бесконечную заточку алгоритма, самым сложным оказалось другое. Убедить модель, что она неправа! 😡

Gemini еще как-то поддается и раскаивается. А вот Claude в последнее время вообще берега путает. Говорит: «Схожу-ка я проверю, правду ли ты мне сказал... А, реально ошибка, извиняюсь. Но я всё равно слежу за тобой, кожаный». Словно переходный возраст у него. В общем повеселилися.

А вы на что сливали свои токены и нервы в последнее время?
MindStudio LLM as Judge: The Agent Safety Pattern Every Builder Needs to Know LLM as judge uses a second AI model to validate agent actions before execution. Learn how this pattern prevents costly mistakes in production workflows.
  • 🔥 10
  • 😁 4
More from @vanillatime
  1. Sep 1, 2026Только что с коллегой вернулись с ассессмента, и я задумался о субъективной оценке дизайне…
  2. Aug 29, 2026Помните шутку «почини принтер, ты ж программист»? А бывало у вас такое же с дизайном? Типа…
  3. Aug 15, 2026Прочёл очень мощное эссе о том, что и так волновало меня какое-то время. Оно о том, что в…
  4. Jul 29, 2026Недавно прочёл книгу Алексея Маркова «Лягушка, слон и брокколи», и она отлично вправляет м…
  5. Jul 14, 2026Буквально на днях вернулся из отпуска и по самую макушку погрузился в разгребание задач. И…
  6. Jun 11, 2026… а не, ещё не всё. Меня в последнее время жёстко триггерит разгребать свалку в чужих исхо…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →