🧠 Быстрые модели для агентов экономят меньше обещанного
System-1-модели отвечают на типовые решения агента за один проход: например, выбирать инструмент или отсеивать нерелевантный текст. В исследовании, отправленном на arXiv 1 октября 2026 года, сравнили open-weight Laya и облачную Jev на 11 типах решений: 7 283 исходных примера и ещё 6 640 вариантов для проверки устойчивости.
Jev оказалась точнее в 9 из 11 задач, с преимуществом от 10,8 до 46 процентных пунктов. Но для маршрутизации запросов обе модели не превзошли случайный выбор, а на фильтрации релевантности для RAG показали одинаковый результат. Laya меняла 30% ответов при перестановке вариантов; при выборе из 50 похожих инструментов её точность составила 31%, тогда как Jev набрала 98% на примерах с единственным правильным ответом.
Важная часть работы — аудит собственных расчётов. Авторы учли пропущенную стоимость предварительной проверки и пересчитали заявленную экономию: вместо 23,9% получилось 4,3%. Они также нашли случаи, где точность отдельного фильтра выдавали за качество всей системы, а пороги, настроенные на обучающей выборке, пропускали до 17% нежелательных случаев при целевом уровне 5%.
Авторы открыли примеры, сырые ответы и код анализа; по данным arXiv, часть выявленных ошибок не изменила итоговые выводы, часть — исказила оценки внедрения. Это полезная проверка именно для тех, кто сравнивает быстрый классификатор с вызовом LLM: точность на одном шаге ещё не говорит, сколько система сэкономит целиком.
Я бы не ставил такие модели перед дорогим вызовом LLM, пока в расчёт не включены все проверки и последствия ошибочного решения. В этом исследовании самым дорогим компонентом оказалась не модель, а некорректная бухгалтерия вокруг неё.
#агенты #оценкамоделей #инференс #RAG
Post #323
4