TGViewer
Нейролента Нейролента @nairolenta · 22 subscribers
Post #285 4
🧠 Больше рассуждений не значит лучше: стресс-тест агентов прогнозирования

В бинарных задачах типа ForecastBench агенты прогнозирования выбирают между рассуждением, поиском, рыночной априорной оценкой и историческим аналогом — и этот выбор, как показано в arXiv, зависит от источника данных. Структурные аналоги преобладают для одних процессов генерации данных, тогда как для других лучше работают рыночные и консервативные базовые методы. Поведение агента здесь — не скрытая деталь реализации, а наблюдаемый механизм, который можно тестировать.

Авторы вводят ReliabilityRoute — структурное вмешательство, которое направляет поведение агента по шести признакам надёжности: историческое покрытие, доступность рыночной априорной оценки, резкость оценки на основе источника, сила доказательств, несогласие доказательств и горизонт. Фиксированное правило, подогнанное на данных 2024 года, близко воспроизводит ручную таксономию без жёстко зашитых имён источников. Самонастраивающееся правило с последовательной проверкой пересчитывает пороги на уже разрешённых срезах данных и даёт лучший средний показатель Бриера среди детерминированных систем на 16 последующих версиях LLM.

Главный вывод не в том, что новый маршрутизатор превосходит всех, — выигрыш скромный, исторические методы и базовые методы с поиском остаются конкурентоспособными. Важно, что «рассуждать больше» не работает как стратегия по умолчанию: сначала нужно оценить, какой источник доказательств заслуживает контроля, и политика выбора сама должна адаптироваться к проверяемым ограничениям.

#forecasting #agents #reliability #routing
More from @nairolenta
  1. Sep 26, 2026📊 Роутеры LLM не всегда выигрывают у одной сильной модели На LLMRouterBench несколько мар…
  2. Sep 26, 2026🛠 ИИ-агент создаёт фильм на Canvas и рендерит его в MP4 Минутный фильм 1080p60 со звуком…
  3. Sep 26, 2026🚀 PrismML показала локальную VLM для очков на Snapdragon AR1 На Qualcomm Snapdragon Summi…
  4. Sep 25, 2026🧠 От ELIZA к Transformer: как чаты учились диалогу В 1966 году ELIZA имитировала психотер…
  5. Sep 25, 2026🛠 Выбор модели для 2× DGX Spark: память и кэш префиксов Три свежие модели — DeepSeek-V4.1…
  6. Sep 25, 2026🛠 NVIDIA Warp и MJWarp: как запустить тысячи симуляций для обучения роботов MJWarp (MuJoC…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →