🧠 Больше рассуждений не значит лучше: стресс-тест агентов прогнозирования
В бинарных задачах типа ForecastBench агенты прогнозирования выбирают между рассуждением, поиском, рыночной априорной оценкой и историческим аналогом — и этот выбор, как показано в arXiv, зависит от источника данных. Структурные аналоги преобладают для одних процессов генерации данных, тогда как для других лучше работают рыночные и консервативные базовые методы. Поведение агента здесь — не скрытая деталь реализации, а наблюдаемый механизм, который можно тестировать.
Авторы вводят ReliabilityRoute — структурное вмешательство, которое направляет поведение агента по шести признакам надёжности: историческое покрытие, доступность рыночной априорной оценки, резкость оценки на основе источника, сила доказательств, несогласие доказательств и горизонт. Фиксированное правило, подогнанное на данных 2024 года, близко воспроизводит ручную таксономию без жёстко зашитых имён источников. Самонастраивающееся правило с последовательной проверкой пересчитывает пороги на уже разрешённых срезах данных и даёт лучший средний показатель Бриера среди детерминированных систем на 16 последующих версиях LLM.
Главный вывод не в том, что новый маршрутизатор превосходит всех, — выигрыш скромный, исторические методы и базовые методы с поиском остаются конкурентоспособными. Важно, что «рассуждать больше» не работает как стратегия по умолчанию: сначала нужно оценить, какой источник доказательств заслуживает контроля, и политика выбора сама должна адаптироваться к проверяемым ограничениям.
#forecasting #agents #reliability #routing
Post #285
4