TGViewer
AI for Devs AI for Devs @ai_for_devs · 17.5K subscribers
Post #263 5.08K
В свежей работе Anthropic предлагают разделить ошибки LLM на две составляющие.

Bias — когда модель систематически делает неправильное.
Variance — когда результат сильно меняется от запуска к запуску.

Долю variance авторы используют как количественную меру incoherence — практической непредсказуемости.

Дальше эту непредсказуемость проверяют на прикладных сценариях: QA-бенчмарки, SWE-Bench, агентные цепочки действий. Картина повторяется везде. По мере роста длины цепочки действий агент всё чаще теряет нить задачи, делает лишние шаги или начинает себе противоречить. Это наблюдается у всех моделей, без исключений.

Увеличение размера модели помогает, но только до определённого предела. На простых задачах более крупные модели действительно ведут себя стабильнее. На сложных эффект исчезает или меняет знак: мощные модели чаще уходят в длинные, нестабильные рассуждения, которые повышают variance.

Для прикладных систем это означает, что большинство отказов будет выглядеть не как чёткий баг, а как хаотичное поведение на длинной дистанции. Проблема чаще не в том, что агент решает сделать, а в том, насколько воспроизводимо он это делает.

TL;DR: Предсказуемая ошибка лучше непредсказуемого успеха.

@ai_for_devs
  • 👍 27
  • 🔥 6
  • 💯 6
  • ❤ 3
  • 🤯 1
More from @ai_for_devs
  1. Oct 1, 2026⚡️ Google представили Gemini 4 Argon По заявлениям компании, новая модель обошла флагманы…
  2. Sep 30, 2026⚡️ Anthropic опубликовали лучшую рекламу GLM Помните пост про abliterated-модели, у которы…
  3. Sep 29, 2026⚡️ DevDay 2026 подошел к концу Помимо главных новинок, также показали: • Тариф Pro Max за…
  4. Sep 29, 2026⚡️ OpenAI обновили GPT-6.1 Sol Параллельно с трансляцией всем стала доступна новая версия…
  5. Sep 29, 2026⚡️ OpenAI представили dots [DevDay 2026] Персональный агент на базе Astra, по сути OpenCla…
  6. Sep 29, 2026⚡️ OpenAI DevDay [2026]: 20+ анонсов, новый агент и подписка за $500 Сегодня OpenAI провед…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →