TGViewer
Циничный AI Циничный AI @cinicai · 234 subscribers
Post #116 212
Anton Goncharenko SKILL.md
🥹 Результатов исследования пост (часть 1)

Итак, technical-premortem skill.

Главные выводы исследования кратко:

1. 🖕 Скилл не добавляет находок.

У нас была прекрасная и красивая когнитивная гипотеза: если дать модели умную инструкцию, то она найдёт больше ошибок.
Так вот, не находит.

Я сравнивал разные версии premortem как между собой, так и работу моделей вообще без скилла (проверь этот план). Оказалось, что голая модель без всякой инструкции находит столько же или больше (в 15% случаев) реальных подтверждённых проблем.

Почему так? Сильные модели уже знают, как делать ревью. Они видели миллионы код-ревью на обучении. Инструкции типа «ищи проблемы с миграциями, проверь конкурентность» не добавляют моделям знаний, которых у них нет. Это как выдать опытному хирургу памятку «не забудь помыть руки» — он и так помоет.

Вывод: если ждёте от промпта/инструкции «модель поумнеет» — не поумнеет. Ценность инструкции в другом (см. следующие пункты).

2. 🎯 Главный измеримый эффект скилла — калибровка вердикта.

У меня в конвеере есть этап - ревью плана.
Написали план - проверили,
исправили находки - проверили,
исправили находки - проверили,...

🌀 Этот цикл мог повторяться и 5, и 7 , и 11 итераций и больше.... На тот момент я был молод и горяч я делал так - писал план опусом и критиковал с помощью gpt. Мне нравилось, что gpt после opus делает много находок (в обратную сторону меньше).
Но это реально накаляло и сильно удлинняло процесс работы + уже после 3-4 итераций становилось очевидно, что это косметические придирки доебался как gpt до opus'a, а не серьёзные проблемы. И приходилось принудительно прерывать этот цикл и отправлять план в работу.

🤝 Что показало исследование! Следите за руками:

GPT-5.6 Sol как ревьюер без скилла вынес BLOCK/NO-GO на 100% прогонов во всех кейсах!!! Включая те планы, которые заслуживали PASS.
Один из заблокированных планов в реальности был отличным и был в своё время реализован без единой проблемы (я же проверл ретроспективно).
Opus показал себя гораздо спокойнее с точки зрения вердикта, сделал находки и выдал 0% жестких блокировок (не могу сказать, повлияло ли на это то, что планы писались с помощью Opus, т.е. одна модель и писала и проверяла)

Когда GPT-5.6 Sol работал с любым вариантом скилла, то он в среднем выдывал только 10-20% жёстких вердиктов на ревью.

Представьте двух ревьюеров:
❤️один всегда пишет "ААААААААА BLOCK!", даже на хороший план.
⏺️второй спокойно говорит: вот правки и поехали, передавайте в разработку.

Со скиллом строгость вердикта стала соответствовать реальности. То есть скилл не помог gpt искать дополнительные проблемы, он помог ей не паниковать и выносить адекватный вердикт.

Почему это даже важнее находок: список находок читает человек и может отфильтровать чушь. А вердикт — это то, на что реагирует процесс: "BLOCK" останавливает работу.
Вместо того, чтобы план/задача автоматически ехала дальше по workflow к агентам-имплементаторам, приходится заниматься лишними перероверками.

Ревьюер, который всегда кричит «стоп», бесполезен — его либо перестают слушать (и тогда пропустят настоящий «стоп»), либо слушаются (и тогда работа стоит вечно).

3. 🚯 Второй воспроизведённый эффект — подавление мусора.

Мусор в отчёте ревью это:
(а) утверждения, которые опровергаются, если просто открыть код («тут нет проверки!» — а она есть);
(б) тревоги, которые никак нельзя проверить («а вдруг что-то пойдёт не так» — а как узнать-то?);
(в) пересказ того, что автор плана и так уже написал в плане, поданный как собственная находка.

🗑Без скилла модели попадали в 2–3 ловушки за прогон.
🗑Отчёты без скилла всегда были самыми длинными — модель льёт воду, когда её не ограничивают.

Мусор - это не про красоту, каждую ложную тревогу нужно проверить и опровергнуть. Если опровергать дорого, отчёты просто перестают читать и ревью умирает как институт.

Полностью мусор скилл не убирает, было 2 ложных «стоп-основания» и в отчётах со скиллом. Но в целом можно сказать что с technical-premortem это исключение, а не тенденция.

4. 🅰️🤍😇🟦 Меньше - лучше, до определенного предела.

Я сделал несколько версий skill.
И не смотря на то, что я сторонник минимализма, я позволил моделям собрать огромные версии скилла — по 600+ строк, с таксономиями рисков, каталогами и шаблонами отчёта.
Кажется, что чем подробнее инструкция, тем тщательнее проверка. Однако, это контринтуитивно. Всё ровно наоборот!

Большие скиллы работали хуже маленьких!


При этом жгли в разы больше токенов и времени.
Почему?
Если дать модели шаблон из 10 секций — она заполнит все 10
Если дать каталог из 200 рисков — она пройдёт его как чек-лист и «найдёт» что-нибудь в каждом пункте. Объём растёт, точность — нет.

Собранный на 77 строк skill показал себя лучше всего.


Возник соблазн ужать еще.
Уменьшил до 50 строк.
50-строчная версия оказалась хуже.
Была потеряна часть находок, один раз выдано ложное основание для блокировки.

Мораль: краткость — не самоцель. Есть строки, которые реально несут эффект. Т.е. балалст можно и нужно резать, но только до опредлённого уровня, который можно нащупать только эмпирически.

#opensource #claude #codex #skills #premortem #research
  • 🔥 5
  • ✍ 2
  • ❤ 1
More from @cinicai
  1. Sep 25, 2026😴 Подписок Claude и Codex комбинирования пост: 1. Планирование. 1.1. Основной агент Opus…
  2. Sep 25, 2026😎 Скайнета приближения пост Не думал, что Skynet окажется настолько точным попаданием не…
  3. Sep 24, 2026photo post
  4. Sep 24, 2026🚬 Мини-эвала Opus 5 vs 5.5 и Sol 5.6 vs 6 пост Пока был занят адским трудом вышли новые O…
  5. Sep 20, 2026Сделал EPUB-версию под Kindle, чтобы увеличить шансы добраться почитать вникнуть
  6. Sep 16, 2026DS 4.1 Flash из параллельной оркестрации множеством параллельных циклов агентов убран(несм…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →