TGViewer
DEKSDEN notes DEKSDEN notes @deksden_notes · 3.11K subscribers
Post #407 459
⚪️ Progressive Disclosure : пробеги по граблям Skills и меморибанки


(Видимо,) В связи с активностью Vercel в отношении скиллов (запуск большой библиотеки Shills.sh) они тут исследование затеяли.

🔗 https://vercel.com/blog/agents-md-outperforms-skills-in-our-agent-evals

Суть их эксперимента в том, что они смотрели как агенты будут пользоваться скиллом, если туда пакануть документацию. Статья хорошая, прочитать стоит.

Что они обнаружили: что агенты не вызывают скиллы. "срезают углы" и идут простейшим путем. Можем не вызвать? не вызываем. Не новость (да, Опус?)!

Клозеды вот даже подучили как эвалы на свой скилл делать, чтобы смотреть когда он вызываетсяя, а когда - нет:

🔗 https://developers.openai.com/blog/eval-skills

В общем, проблема известная.

👉 Вкратце:
• просто поставить скилл почти совсем не помогает
• явный промптинг "используй скилл" уже заметно помогает
• лучше всего помогает если индекс явно грузить через AGENTS.md (индексный файл, ага) - но тогда теряется progressive disclosure
• думать надо именно в контексте progressive, то есть если сначала грузить документацию, а только потом смотреть на проект, то реультаты хуже чем если сначала смотреть на проект, а потом - в документацию. Это логично: агент будет знать чего смотреть конкретно и зачем.

При чем тут меморибанк? Дело в том, что я давно строю проекты с использованием именно меморибанков на progressive disclosure принципах (еще с тех времен когда они так не назывались - в закрепе канала индекс есть). И я давно свои флоу строю на явных директивных указаниях исследовать проект/меморибанк.

▶️ Vercel тут переоткрыл то, что давно было видно из практики работы с меморибанком: работают детерминированные этапы флоу - сначала готовим контекст явными промптами, потом работаем с ним. Для подготовки контекста принцип progressive disclosure работает хорошо - но только если его готовить.

Оставить все на откуп текущему поколению агентов нельзя, это не работает или работает неважно.

В следующем поколении, возможно (и скорее всего!) будет заметно лучше, раз скиллы настолько пошли в народ. Но пока - директивно праймим контекст.

(ц) А статейку то сами - прочтите, да!)

@deksden_notes
Vercel AGENTS.md outperforms skills in our agent evals A compressed 8KB docs index in AGENTS.md achieved 100% on Next.js 16 API evals. Skills maxed at 79%. Here's what we learned and how to set it up.
  • ❤ 8
  • 👍 2
More from @deksden_notes
  1. Oct 8, 2026⚪️ Grok Bot получил доступк к X Ранее давали кредиты $15 при налаживании коннекта с платфо…
  2. Oct 8, 2026⚪️ Что бы это значило? WAT? Грок будет использовать клод?! Грок 4.8 оказался не таким аген…
  3. Oct 7, 2026⚪️ Codex Reset (banked) и 3-й день 28 дневного ship-темберя Это было быстро! Клозеды сегод…
  4. Oct 7, 2026⚪️ Decision Models бенчмарки В одном из своих пайплайнов сделал мелкий тестовый стенд и пр…
  5. Oct 7, 2026⚪️ Haiku 5.5 Хайку обновили, и, видимо, это модель из трендовой нынче категории флешей - у…
  6. Oct 7, 2026⚪️ Чат - 1к Что промо животворящее делает! Бодро добрались до 1к участников в чате Всех по…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →