Окно на миллион токенов не отменило работу с контекстом
Окна моделей выросли до миллиона токенов и появилось ощущение, что можно складывать в контекст всё подряд, места хватит.
Давайте разберёмся, почему это не сработало.
В июле 2025 года Chroma прогнала 18 моделей на входах разной длины: Claude, GPT, Gemini, Qwen. Chroma делает базу для векторного поиска, то есть интерес в этой теме у неё большой и читать замер стоит с поправкой на это.
Вывод, модели не держат одинаковое качество на разной длине входа. Причём деградация начинается задолго до физического предела окна и идёт она неровно, провалами.
У этого есть название, context rot, гниение контекста.
Anthropic в статье про контекст инжиниринг (context engineering) называет контекст конечным ресурсом с убывающей отдачей. Объясняет через бюджет внимания: он у модели ограничен, каждый новый токен его тратит и поэтому чем длиннее контекст, тем строже приходится отбирать, что в него класть.
Поэтому большое окно не заменило работу с контекстом. Оно отодвинуло точку, где отсутствие этой работы становится заметным и подняло цену ошибки, за лишнее в окне вы платите на каждом шаге, и платите не один раз.
Источники:
1) Замер Chroma "Context Rot: How Increasing Input Tokens Impacts LLM Performance"
2) Anthropic, "Effective context engineering for AI agents"
Post #2007
1.08K
- ❤🔥 3
- 👍 3
- 🎉 1
- 💯 1