Китайский стартап сократил стоимость работы агентов на 89%, переключая модели на лету
На конференции Yunqi 2026 в Ханчжоу CTO стартапа Jiyuan Lüdong Хань Кай рассказал о системе динамической маршрутизации между языковыми моделями. Идея простая: одна модель-флагман дорого стоит и медленно отвечает, а сложный агент за одну задачу делает десятки вызовов — значит, каждый вызов стоит подбирать под нужную модель.
Компания выложила в open source проект OpenSquilla, который решает именно эту задачу. По их внутренним тестам: по сравнению с фиксированным использованием флагманской модели система сохраняет 99,96% качества задач, снижая стоимость на 88,9%. В тесте по задачам глубокого исследования (DRACO) конфигурация с несколькими моделями обошла лучшую одиночную модель из той же группы — при затратах в треть от её цены.
Помимо маршрутизации, Хань Кай описал то, что в компании называют RSI-петлёй (рекурсивное самосовершенствование): агент выполняет задачи → система оценивает слабые места модели и стратегии выбора → проводится дообучение → улучшенная модель возвращается в работу.
Первым результатом этого подхода стала серия NeoHorse-1, выпущенная в сентябре 2026 года. Модели дообучены на базе Qwen3.5 от Alibaba. Согласно техническому отчёту: версия 4B подняла макро-среднее по десяти бенчмаркам с 58,94 до 64,87 балла; версия 9B — с 65,60 до 69,04. При этом 4B после дообучения превзошла базовую модель Qwen3.5-9B на пяти из десяти тестов: VitaBench, τ²-Bench, PinchBench, QwenClawBench и HumanEval.
Инфраструктурно: Alibaba Cloud обеспечивает облачные сервисы для работы продуктов компании, компания Wuwen Xinqiong предоставила вычислительные мощности и оптимизацию инфраструктуры для обучения и инференса NeoHorse-1. С командой Qwen ведётся совместное тестирование сценариев и верификация новых версий моделей.
Источник: QbitAI (🇨🇳)
#YuansuRhythm #AlibabaCloud #Qwen #NeoHorse1 #агент #модели
Post #2700
8