TGViewer
FastNews | Никита Пастухов FastNews | Никита Пастухов @fastnewsdev · 2.58K subscribers
Post #389 3K
Хватит нести бред про миллион токенов

Я заебался это слушать. Каждый релиз модели - новое окно на 1кк, и каждый раз находится кто-то, кто выдает: теперь можно не думать о контексте.

Нельзя. Больше 200к пихать в модель бессмысленно, и это не просто мой опыт. Умные дядьки все посчитали.

В июле я про это уже писал: https://t.me/fastnewsdev/360. Тогда это опиралось на мой опыт, без единого пруфа. На днях поспорил в чате, услышал, что представления у меня устаревшие, и полез за пруфами. Собрал сильно больше, чем ждал😅

Lost in the middle, 2023 год

Стэнфордская статья, с которой все началось. Модели дают вопрос и пачку документов, а нужный двигают - в начало, в середину, в конец. Выходит U-образная кривая: края модель использует, середину теряет.

Но самое прикольное даже не это. Когда нужный документ лежал в середине, GPT-3.5 отвечал ХУЖЕ, чем когда ему вообще не давали документов. Контекст в этой позиции не бесполезен, а даже вредит.

И вторая находка: модели с расширенным окном показали ровно те же цифры, что и базовые. Уже в 2023 измерили - окно побольше не значит, что модель им пользуется.

Context Rot, 2025 год

Отчет Chroma на 18 моделях - Claude 4, GPT-4.1, Gemini 2.5. Отсюда термин.

Главное: деградация - это НЕ переполнение окна. Модель начинает врать задолго до лимита и на тривиальных задачах.

• чем меньше вопрос буквально совпадает с ответом - тем быстрее падение качества
• на перемешанном тексте модели работают даже лучше, чем на связном

Почему так

Внимание - это распределение фиксированной суммы. Модель раскладывает 100% внимания по всем токенам окна: чем их больше, тем меньше достается каждому. Между 8к и 256к разница в 32 раза. Плюс училась она на коротких текстах - двухсоттысячную позицию почти не видела. Отсюда и края: начало с концом конкуренцию выигрывают, середина проигрывает.

И главное - у модели нет адресной памяти. Она не достает факт, а размазывает по нему внимание вместе со всем остальным мусором. Поэтому хорошим поиском это не лечится, измерено отдельно: даже когда модель извлекает все нужное идеально, качество падает на 13.9-85%.

Самое демонстративное

LOCA-bench, февраль 2026. Агенту дают задачу и раздувают вокруг него окружение, не трогая задачу. Точность по длине:

• Claude-4.5-Opus: 96% на 8к, 84% на 32к, 65% на 64к, 34% на 128к, 14.7% на 256к
• GPT-5.2-Medium: 72%, 60%, 52%, 38.7%, 21.3%
• Gemini-3-Flash: 64%, 40%, 36%, 21.3%, 17.3%

У Opus заявленное окно - 200к, и на 256к от него остается 14.7%. Причем мои 200к тут выглядят даже щедро. Половина точности теряется уже к 100к.

Самое свежее

PredicateLongBench от NVIDIA, июль 2026. Модели совсем свежие - Opus 4.6, GPT-5.4, Gemini 3.1 Pro.

История повторяется: на сложных вариантах Opus 4.6 проваливается до 7%, а на самом тяжелом лучший результат - 10% у Gemini при 1% у Opus и GPT😑

Что с этим делать

Вывод ровно один: контекст надо не чистить, а не засорять.

Там же померили, что помогает при 128к: programmatic tool calling поднимает GPT-5.2 с 38.7% до 49.3%, context awareness тащит Gemini с 21.3% до 33.3%. А тупое удаление старого не дает почти ничего - очистка тулколлов +1.3 пункта, автокомпакция (привет, /compact) местами вообще в минус.

Что из этого делаю я:

Одна сессия - одна задача. Не тянуть диалог, пока он не превратился в тыкву
План живет в файле, а не в диалоге. О чем и был пост про SDD
Progressive disclosure. Пусть агент сам сходит за информацией, когда понадобится
Никакой надежды на автокомпакцию. Померили на агентах: полный контекст 85.7%, он же со сжатием - 63.7%. Если использовать /compact - то только с указанием, что должно остаться

И перестаньте смотреть на чиселко максимального контекста при выборе модели. Его вам и так хватит.

Контроль контекста - не оптимизация и не тюнинг для задротов. Сейчас это ваша основная работа. Пока не поменяется архитектура моделей - придется приседать вокруг контекста руками.

Можете кидать этот пост любым приверженцам "А у X КОНТЕКСТ БОЛЬШЕ" - пусть спорят со мной в комментариях

#архитектура #AI
Telegram FastNews | Никита Пастухов Поздравляю, вы уже пользуетесь SDD Если вы хоть раз гоняли агента через plan-mode - вы уже в SDD-клубе, просто об этом не знали. Я обещал вам рассказать про свой опыт с сетапом скиллов Мэтта, но без разговора об SDD ничего не получится Так что заходить…
  • 👍 32
  • 🔥 11
  • ❤ 2
  • 🤔 1
More from @fastnewsdev
  1. Sep 20, 2026Последние 2 недели я заметил, что Opus 5 значительно отупел в Claude Code. Обычно такое сл…
  2. Sep 18, 2026С днем рождения🎉 Сегодня, ровно 3 года назад, 18 сентября 2023 года, вышла первая версия…
  3. Sep 17, 2026Забавно, что лучшую иллюстрацию OpenSource комьюнити я нашел в сериале про рестораны... См…
  4. Sep 14, 2026Я снова пропустил #digest агенсткого тулинга, потому что там все как-то тухленько. Но кое-…
  5. Sep 10, 2026Я сам себя заменю. Это мой карьерный план! У Прокопова был интересный пост: 20 лет точил с…
  6. Sep 7, 2026Я как-то немного потерял смысл делать #digest агентского тулинга, т.к. там сейчас только и…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →