TGViewer
Kremniy; | Александр Дмитриев Kremniy; | Александр Дмитриев @siliconchannel · 4.96K subscribers
Post #231 3.39K
Подход к обучению промтов.

Привет! Уверен, что 100% людей тут писали свои промты, многие наверняка писали и проекты с промтами - будь то какой-нибудь финансовый помощник или подсчёт калорий по фото. И наверняка сталкивались с тем, что решение многих задачек сводится к тому, чтобы написать хороший промт, который как можно чаще будет выдавать удовлетворительный результат. В целом это одна из задач AI-разработки - уметь написать промты в пайплайне так, чтобы они выдавали удовлетворительный результат.

Очевидно, что раз ИИ - штука недетерминированная, то и процесс этот не имеет чёткого алгоритма, а превращается в любимый итеративный подход: исправляем предыдущие ошибки, прогоняем пайплайн, смотрим, стало хуже или лучше, после чего идём улучшать дальше - или откатываем и пытаемся исправить текущее.

Идейно это похоже на подход к обучению в классическом ML, только там учат веса и есть понятная эвристика, а у нас вместо весов промт и эвристика не такая понятная. Это заметили ребята из Microsoft и сделали штуку для обучения скиллов - SkillOpt (очевидно, раз скилл - это промт в .md, то так можно обучать любые промты). Логика такая: если модель файнтюнить дорого и не всегда оправданно - давайте её заморозим, а обучать будем то, что подаётся на вход, замеряя то, что получается на выходе. Собственно, чтобы замерять, нам необходим хороший голден-датасет, который надо держать в актуальном и хорошем состоянии - и в целом он у вас и так должен быть, чтобы понимать, в каком состоянии находится продукт и что вы ничего не сломали, меняя промт.

Раз промт - это веса, и обучаем мы его как веса, то и болячки у него те же, что у весов. А болячки эти давно известные, с давно известными решениями, и выглядят они так:

• learning rate → бюджет правок за шаг, с затуханием. Если разрешить оптимизатору переписывать документ целиком - он сотрёт хорошие правила вместе с плохими. Ограниченные правки сохраняют преемственность
• отложенная валидация → приёмочный гейт. Сохраняем только те изменения, которые реально повлияли на метрики
• негативный фидбек → буфер отклонённых правок. Оптимизатор помнит собственные провалы и не предлагает их по второму кругу
• momentum → долгосрочная память. Уроки, пережившие несколько эпох, переезжают в защищённую область документа, которую быстрые правки не трогают

Экспериментально ребятам из майкрософта удалось показать, что абляция любого из четырёх пунктов приводит к тому, что промты начинают выдавать говно и переобучаться (не знаю, как это ещё обозвать). Кто мы такие, чтобы не верить на слово ребятам из майкрософта - так что поверим.

По бенчмаркам у Microsoft вышло, что подход в целом имеет право на жизнь и вполне работоспособен, по крайней мере на скиллах. Шесть бенчмарков, семь моделей, три харнесса - лучший или разделённый первый результат во всех 52 комбинациях, на GPT-5.5 обученный скилл добавляет от 19 до 25 пунктов точности. Дополнительно у подхода оказалось ещё два плюса:

• Во-первых, промты - по сути бесплатное улучшение системы: не надо крутить дополнительные вызовы, перегенерации и т.д., так что этот подход условно бесплатно и безболезненно позволяет получать профит в продуктах
• Во-вторых, оказалось, что промт, обученный на одной модели, показывает прирост и на других - так что особых проблем с переходом на свежие модели или другое семейство быть не должно

Так что https://github.com/microsoft/skillopt - пробуйте, делитесь вашими экспериментами и результатами.
GitHub GitHub - microsoft/SkillOpt: SkillOpt is a text-space optimizer that trains reusable natural-language skills for frozen LLM agents… SkillOpt is a text-space optimizer that trains reusable natural-language skills for frozen LLM agents through trajectory-driven edits, validation-gated updates, and deployable best_skill.md artifac...
  • ❤ 14
  • 🔥 5
  • 👍 1
More from @siliconchannel
  1. Sep 14, 2026Привет! Сегодня созвонился с очень классным нашим коллегой, и этот разговор натолкнул меня…
  2. Aug 24, 2026Indiehaha на главном стартап-портале СНГ-региона.🤙 Привет! Многие, наверное, знают мой пр…
  3. Aug 2, 2026Я нанял плюшевую лягушку за 5 долларов в месяц, и она принесла мне 40 долларов за 2 недели…
  4. Aug 2, 2026photo post
  5. Jul 25, 2026Post #228
  6. Jul 17, 2026Go 1.27 сломал ваши шпаргалки к собесам😨 Привет! Сегодня пришлось вспомнить, что вообще я…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →