Итак,
technical-premortem skill. Главные выводы исследования кратко:
1. 🖕 Скилл не добавляет находок.
У нас была прекрасная и красивая когнитивная гипотеза: если дать модели умную инструкцию, то она найдёт больше ошибок.
Так вот, не находит.
Я сравнивал разные версии premortem как между собой, так и работу моделей вообще без скилла (проверь этот план). Оказалось, что голая модель без всякой инструкции находит столько же или больше (в 15% случаев) реальных подтверждённых проблем.
Почему так? Сильные модели уже знают, как делать ревью. Они видели миллионы код-ревью на обучении. Инструкции типа «ищи проблемы с миграциями, проверь конкурентность» не добавляют моделям знаний, которых у них нет. Это как выдать опытному хирургу памятку «не забудь помыть руки» — он и так помоет.
Вывод: если ждёте от промпта/инструкции «модель поумнеет» — не поумнеет. Ценность инструкции в другом (см. следующие пункты).
2. 🎯 Главный измеримый эффект скилла — калибровка вердикта.
У меня в конвеере есть этап - ревью плана.
Написали план - проверили,
исправили находки - проверили,
исправили находки - проверили,...
🌀 Этот цикл мог повторяться и 5, и 7 , и 11 итераций и больше.... На тот момент
Но это реально накаляло и сильно удлинняло процесс работы + уже после 3-4 итераций становилось очевидно, что это косметические придирки доебался как gpt до opus'a, а не серьёзные проблемы. И приходилось принудительно прерывать этот цикл и отправлять план в работу.
🤝 Что показало исследование! Следите за руками:
GPT-5.6 Sol как ревьюер без скилла вынес BLOCK/NO-GO на 100% прогонов во всех кейсах!!! Включая те планы, которые заслуживали PASS.
Один из заблокированных планов в реальности был отличным и был в своё время реализован без единой проблемы (я же проверл ретроспективно).
Opus показал себя гораздо спокойнее с точки зрения вердикта, сделал находки и выдал 0% жестких блокировок (не могу сказать, повлияло ли на это то, что планы писались с помощью Opus, т.е. одна модель и писала и проверяла)
Когда GPT-5.6 Sol работал с любым вариантом скилла, то он в среднем выдывал только 10-20% жёстких вердиктов на ревью.
Представьте двух ревьюеров:
❤️один всегда пишет "ААААААААА BLOCK!", даже на хороший план.
⏺️второй спокойно говорит: вот правки и поехали, передавайте в разработку.
Со скиллом строгость вердикта стала соответствовать реальности. То есть скилл не помог gpt искать дополнительные проблемы, он помог ей не паниковать и выносить адекватный вердикт.
Почему это даже важнее находок: список находок читает человек и может отфильтровать чушь. А вердикт — это то, на что реагирует процесс: "BLOCK" останавливает работу.
Вместо того, чтобы план/задача автоматически ехала дальше по workflow к агентам-имплементаторам, приходится заниматься лишними перероверками.
Ревьюер, который всегда кричит «стоп», бесполезен — его либо перестают слушать (и тогда пропустят настоящий «стоп»), либо слушаются (и тогда работа стоит вечно).
3. 🚯 Второй воспроизведённый эффект — подавление мусора.
Мусор в отчёте ревью это:
(а) утверждения, которые опровергаются, если просто открыть код («тут нет проверки!» — а она есть);
(б) тревоги, которые никак нельзя проверить («а вдруг что-то пойдёт не так» — а как узнать-то?);
(в) пересказ того, что автор плана и так уже написал в плане, поданный как собственная находка.
🗑Без скилла модели попадали в 2–3 ловушки за прогон.
🗑Отчёты без скилла всегда были самыми длинными — модель льёт воду, когда её не ограничивают.
Мусор - это не про красоту, каждую ложную тревогу нужно проверить и опровергнуть. Если опровергать дорого, отчёты просто перестают читать и ревью умирает как институт.
Полностью мусор скилл не убирает, было 2 ложных «стоп-основания» и в отчётах со скиллом. Но в целом можно сказать что с
technical-premortem это исключение, а не тенденция.4. 🅰️🤍😇🟦 Меньше - лучше, до определенного предела.
Я сделал несколько версий skill.
И не смотря на то, что я сторонник минимализма, я позволил моделям собрать огромные версии скилла — по 600+ строк, с таксономиями рисков, каталогами и шаблонами отчёта.
Кажется, что чем подробнее инструкция, тем тщательнее проверка. Однако, это контринтуитивно. Всё ровно наоборот!
Большие скиллы работали хуже маленьких!
При этом жгли в разы больше токенов и времени.
Почему?
Если дать модели шаблон из 10 секций — она заполнит все 10
Если дать каталог из 200 рисков — она пройдёт его как чек-лист и «найдёт» что-нибудь в каждом пункте. Объём растёт, точность — нет.
Собранный на 77 строк skill показал себя лучше всего.
Возник соблазн ужать еще.
Уменьшил до 50 строк.
50-строчная версия оказалась хуже.
Была потеряна часть находок, один раз выдано ложное основание для блокировки.
Мораль: краткость — не самоцель. Есть строки, которые реально несут эффект. Т.е. балалст можно и нужно резать, но только до опредлённого уровня, который можно нащупать только эмпирически.
#opensource #claude #codex #skills #premortem #research