TGViewer
Нейросети на практике Нейросети на практике @neuralfordevs · 65 subscribers
Post #8 98
«Контекстрот» Часть 2: 📐 После скольки токенов агент перестаёт думать — формула

Можно прикинуть в формуле, и довольно близко к реальности. Три уровня модели — от softmax-математики к практической эвристике.

────────

1. Из softmax-математики

Атеншн-веса считаются как softmax от скоров: для нужного токена (needle) и n−1 шумовых:

attention_to_needle ≈ 1 / (1 + (n−1) × exp(σ²/2 − s))

где s — насколько релевантен нужный токен (скор внимания), σ² — разброс скоров случайных токенов. Это сигмоидальный спад.

Точка, где внимание к нужному токену падает до 50%:

n* ≈ exp(s − σ²/2)

Это «горизонт» в чистой математике. Для уверенной семантической метки s ≈ 5-7, σ² ≈ 1-2 — n* выходит на 100-2000 «равных конкурентов». С учётом multi-head и позиционных эмбеддингов реальный n* для качественной выборки получается ~10K-50K токенов.

Софтмакс «теряет» одну важную точку среди ~30K шумовых уже к нулю влияния. Это не баг, это математика.

────────

2. Эмпирический фит на данные Chroma

Их кривая needle-in-a-haystack для топовых моделей (Claude Opus 4.5, GPT-5) хорошо ложится на логарифмический спад:

q(n) ≈ q₀ × (1 − α × ln(n / n₀))

С параметрами для топ-моделей в 2026: q₀ = 1.0 при n₀ = 4K, α ≈ 0.10.

Подставляем:
→ 32K токенов → q ≈ 0.79 (потеря 21%)
→ 100K → q ≈ 0.68 (потеря 32%)
→ 500K → q ≈ 0.52 (потеря 48%)
→ 1M → q ≈ 0.45 (потеря 55%)

Дополнительно — power-law вариант: q(n) ≈ (n / 4K)^(−0.11), даёт практически те же числа. Логарифм проще держать в голове.

────────

3. Mental-модель: «зоны опасности»

Для агентских пайплайнов в 2026:

→ Зелёная зона < 32K токенов — качество ≥ 80% от бейзлайна. Делай что хочешь, не парься.

→ Жёлтая 32K – 100K — качество 65-80%. Уже стоит структурировать контекст: явные секции, заголовки, summary в начале.

→ Красная 100K – 500K — качество 50-65%. Без компакции и sub-agents работать бессмысленно.

→ Мёртвая > 500K — окно «есть» только формально. 1M контекст у Gemini это маркетинг для needle-retrieval, не для агентских задач.

────────

Две эвристики на запомнить

→ Каждое удвоение контекста = минус 7-10 п.п. качества. Это прямое следствие логарифмического спада с α≈0.1.

→ 5 sub-agents по 30K каждый > один агент с 150K. Тех же токенов суммарно, но качество ~80% против ~60%. Точка перехода «обслуживать контекст vs запустить sub-agent с чистого листа» — в районе 100K.

────────

Скрин этой формулы можно прикреплять в любой технический спор про контекст. «У нас же 1М окно» работает только для retrieval, не для размышлений в этом окне.

В Части 3 разберу, что из этого уже встроено в Claude Code / Cursor / Codex и что приходится делать самому. Если тема актуальна — пересылай тем, кто строит агентские пайплайны или удивляется почему «он же помнит, но забыл».

#контекстрот #agents #contextengineering #neuralfordevs
  • 🔥 3
More from @neuralfordevs
  1. Jul 30, 2026🤔 Что выбрать новичку Claude или Codex? Это вопрос, который я часто слышу от тех, кто тол…
  2. Jul 15, 2026#разрушителимифов У Димы, чей разгромный тест Caveman я упоминал неделю назад, вышло новое…
  3. Jul 15, 2026Таки не заленился и написал статью про Headroom!)
  4. Jul 13, 2026Как работает кэш токенов? В процессе написания статьи про HeadroomProxy чуть глубже погруз…
  5. Jul 7, 2026🍄 Разрушители мИИфов: тестируем Headroom Когда я писал прошлый разбор про Caveman, то на…
  6. Jun 23, 2026💡 Мысль дня: Устаревание контента и забывание – ключевой процесс для корпоративной Базы з…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →