«Контекстрот» Часть 2: 📐 После скольки токенов агент перестаёт думать — формула
Можно прикинуть в формуле, и довольно близко к реальности. Три уровня модели — от softmax-математики к практической эвристике.
────────
1. Из softmax-математики
Атеншн-веса считаются как softmax от скоров: для нужного токена (needle) и n−1 шумовых:
attention_to_needle ≈ 1 / (1 + (n−1) × exp(σ²/2 − s))
где s — насколько релевантен нужный токен (скор внимания), σ² — разброс скоров случайных токенов. Это сигмоидальный спад.
Точка, где внимание к нужному токену падает до 50%:
n* ≈ exp(s − σ²/2)
Это «горизонт» в чистой математике. Для уверенной семантической метки s ≈ 5-7, σ² ≈ 1-2 — n* выходит на 100-2000 «равных конкурентов». С учётом multi-head и позиционных эмбеддингов реальный n* для качественной выборки получается ~10K-50K токенов.
Софтмакс «теряет» одну важную точку среди ~30K шумовых уже к нулю влияния. Это не баг, это математика.
────────
2. Эмпирический фит на данные Chroma
Их кривая needle-in-a-haystack для топовых моделей (Claude Opus 4.5, GPT-5) хорошо ложится на логарифмический спад:
q(n) ≈ q₀ × (1 − α × ln(n / n₀))
С параметрами для топ-моделей в 2026: q₀ = 1.0 при n₀ = 4K, α ≈ 0.10.
Подставляем:
→ 32K токенов → q ≈ 0.79 (потеря 21%)
→ 100K → q ≈ 0.68 (потеря 32%)
→ 500K → q ≈ 0.52 (потеря 48%)
→ 1M → q ≈ 0.45 (потеря 55%)
Дополнительно — power-law вариант: q(n) ≈ (n / 4K)^(−0.11), даёт практически те же числа. Логарифм проще держать в голове.
────────
3. Mental-модель: «зоны опасности»
Для агентских пайплайнов в 2026:
→ Зелёная зона < 32K токенов — качество ≥ 80% от бейзлайна. Делай что хочешь, не парься.
→ Жёлтая 32K – 100K — качество 65-80%. Уже стоит структурировать контекст: явные секции, заголовки, summary в начале.
→ Красная 100K – 500K — качество 50-65%. Без компакции и sub-agents работать бессмысленно.
→ Мёртвая > 500K — окно «есть» только формально. 1M контекст у Gemini это маркетинг для needle-retrieval, не для агентских задач.
────────
Две эвристики на запомнить
→ Каждое удвоение контекста = минус 7-10 п.п. качества. Это прямое следствие логарифмического спада с α≈0.1.
→ 5 sub-agents по 30K каждый > один агент с 150K. Тех же токенов суммарно, но качество ~80% против ~60%. Точка перехода «обслуживать контекст vs запустить sub-agent с чистого листа» — в районе 100K.
────────
Скрин этой формулы можно прикреплять в любой технический спор про контекст. «У нас же 1М окно» работает только для retrieval, не для размышлений в этом окне.
В Части 3 разберу, что из этого уже встроено в Claude Code / Cursor / Codex и что приходится делать самому. Если тема актуальна — пересылай тем, кто строит агентские пайплайны или удивляется почему «он же помнит, но забыл».
#контекстрот #agents #contextengineering #neuralfordevs
Post #8
98

- 🔥 3