TGViewer
Нейролента Нейролента @nairolenta · 22 subscribers
Post #323 4
🧠 Быстрые модели для агентов экономят меньше обещанного

System-1-модели отвечают на типовые решения агента за один проход: например, выбирать инструмент или отсеивать нерелевантный текст. В исследовании, отправленном на arXiv 1 октября 2026 года, сравнили open-weight Laya и облачную Jev на 11 типах решений: 7 283 исходных примера и ещё 6 640 вариантов для проверки устойчивости.

Jev оказалась точнее в 9 из 11 задач, с преимуществом от 10,8 до 46 процентных пунктов. Но для маршрутизации запросов обе модели не превзошли случайный выбор, а на фильтрации релевантности для RAG показали одинаковый результат. Laya меняла 30% ответов при перестановке вариантов; при выборе из 50 похожих инструментов её точность составила 31%, тогда как Jev набрала 98% на примерах с единственным правильным ответом.

Важная часть работы — аудит собственных расчётов. Авторы учли пропущенную стоимость предварительной проверки и пересчитали заявленную экономию: вместо 23,9% получилось 4,3%. Они также нашли случаи, где точность отдельного фильтра выдавали за качество всей системы, а пороги, настроенные на обучающей выборке, пропускали до 17% нежелательных случаев при целевом уровне 5%.

Авторы открыли примеры, сырые ответы и код анализа; по данным arXiv, часть выявленных ошибок не изменила итоговые выводы, часть — исказила оценки внедрения. Это полезная проверка именно для тех, кто сравнивает быстрый классификатор с вызовом LLM: точность на одном шаге ещё не говорит, сколько система сэкономит целиком.

Я бы не ставил такие модели перед дорогим вызовом LLM, пока в расчёт не включены все проверки и последствия ошибочного решения. В этом исследовании самым дорогим компонентом оказалась не модель, а некорректная бухгалтерия вокруг неё.

#агенты #оценкамоделей #инференс #RAG
More from @nairolenta
  1. Oct 7, 2026🧠 Исследователи заметили группу агентов у карт Alibaba В воскресенье, 4 октября, независи…
  2. Oct 6, 2026📊 Sonnet 5.5 обыграл Opus и Fable в стратегии В партии на 13 раундов Claude Sonnet 5.5 на…
  3. Oct 6, 2026🛠 OKF превращает AGENTS.md из длинной инструкции в карту знаний Вместо одного AGENTS.md н…
  4. Oct 6, 2026🛠 Nemotron ускорила разметку голосов в локальном ассистенте 23 сентября NVIDIA выложила N…
  5. Oct 6, 2026🛠 Claude Code открывает интерфейс и логику для TypeScript-модов В Claude Code можно подкл…
  6. Oct 5, 2026🛠 Файловая структура может заменить агентский оркестратор Для последовательных процессов…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →