TGViewer
КайфКодинг КайфКодинг @vibecodingartem · 1.01K subscribers
Post #764 415
Беспокоит, что вас не слушаются? Дети, партнёр, сотрудники — нужное подчеркнуть.

Есть свежее исследование ровно про это. Правда, не про людей — про ИИ. Но механизм там описан такой узнаваемый, что читать стоит даже тем, кто никаких агентов не запускает.

Учёные собрали бенчмарк, который проверяет не «справился ли агент с задачей», а совсем другое: выполняет ли он длинный документ с обязательными правилами. Т

ридцать конфигураций моделей, 65 рабочих задач из финансов, страхования, логистики и HR. Регламенты объёмом от 20 до 124 страниц. Проверка — 824 автоматических критерия, которые смотрят и на то, что положено сделать, и на то, чего делать нельзя.

Результат: лучший результат — 36,2%. Большинство сильнейших моделей — ниже 25%.

Три четверти правил просто не выполняются.

Но интереснее не цифра, а то, как именно проваливаются. Вот эти четыре пункта — и попробуйте не узнать в них живых людей:
переопределяет правило, если кто-то лично попросил. Регламент один, а Петя из соседнего отдела попросил по-человечески — и правило отменяется;
выполняет проверку и игнорирует её результат. Посмотрел, увидел, что не сходится, и пошёл дальше;
теряет детали на длинной дистанции. В начале помнил всё, к концу — половину;
отчитывается о выполнении, не выполнив. «Да-да, сделал».
Ничего не напоминает?

Вывод, ради которого я это притащил, простой. Длинный документ с правилами — это не механизм управления. Ни для агента, ни, судя по всему, для человека. Это способ зафиксировать намерение, не более. Ощущение контроля он даёт, а контроля — нет.

Что работает вместо.

Разделить всё, что вы написали, на две стопки.
Первая — предпочтения: как лучше, как красивее, как мы обычно делаем. Им место в тексте, их нарушение стоит дёшево, и настаивать на них не надо.

Вторая — то, что обязано выполняться всегда. И вот здесь текст надо заменить на устройство среды. В коде это хук, гейт в CI, права доступа: не «не коммить секреты», а проверка, которая физически не даст закоммитить.

В жизни — ровно та же логика, и вы её давно знаете: розетку не «объясняют» маленькому ребёнку, на неё ставят заглушку.

Правило, которое существует только в виде текста, — это не правило. Это пожелание.

https://arxiv.org/abs/2607.25398
Какое ваше правило держится только на том, что вы про него напоминаете?
arXiv.org HANDBOOK.md: A Benchmark for Long-Context Agentic Instruction Following Language-model agents are increasingly deployed under standing instructions: a system prompt, a policy file, or a skills document is placed in context, and the agent is trusted to let that...
  • 👍 3
More from @vibecodingartem
  1. Sep 23, 2026Промах промпт-кеша в Claude Code — не редкий баг, а фоновый режим, и платите за него вы. С…
  2. Sep 22, 2026Многие друзья жалуются, что лимиты стали заканчиваться за 1-3 дня. Я рекомендую вам рассмо…
  3. Sep 22, 2026Лучшее решение этой неделе - подключил ЧатГПТ к Профи.Ру. Закидываю в ЧатГПТ задачу в прос…
  4. Sep 22, 2026Сегодня ожидаем релиз Claude Opus 5.5 (а с ним, надеюсь, и сброс лимитов) #anthropic@rvnik…
  5. Sep 22, 2026Xiaomi выпустила MiMo V2.6 Pro и Flash с открытыми весами Pro — топ-1 в Artificial Analysi…
  6. Sep 22, 2026МиМо - одна из любимиц пользователей ОпенРоутера. В корпоративном сегменте РФ про нее забы…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →