10 сентября исследователи представили CAUC — каскад моделей без отдельного обучаемого маршрутизатора.
Сначала система калибрует уверенность каждой модели на проверочной выборке, чтобы значение вроде
0,9 означало примерно одинаковую вероятность правильного ответа. Затем запрос получает дешёвая модель:🔘 если её уверенность достаточна, ответ принимается;
🔘 если нет — вызывается более сильная модель;
🔘 ответы объединяются, только когда ошибки моделей действительно дополняют друг друга.
При добавлении новой модели не нужно переобучать весь маршрутизатор: достаточно откалибровать её и обновить порог.
На шести языковых тестах CAUC пропустила около 47% вызовов сильной модели, одновременно повысив точность относительно её одиночного использования в среднем на 1,9%.
Вывод: каскад стоит строить не на сыром
confidence, который у разных моделей означает разное, а на откалиброванной вероятности ошибки.Ограничение существенное: эксперименты проводились на задачах с вариантами ответа и доступом к логитам. Стоимость считалась по размеру моделей, а не по реальным ценам и задержкам API.
Пруф: исследование CAUC от 10 сентября 2026 года
#llm #modelrouting #modelcascade #calibration #inference #llmops
@data_engi