Самая большая экономия сейчас не в выборе модели, а в том, чтобы перестать звать дорогую на всё подряд.
Microsoft выкатила MAI-Cyber-1-Flash — компактную специализированную модель для поиска уязвимостей — и встроила её в свой пайплайн MDASH. Интересна не модель, а структура.
Маленькая модель забирает до 90% задач безопасности. Флагман остаётся на оставшиеся 10%, где нужна голова. Итог: 95,95% на бенчмарке CyberGym против 83,2–85,6% у всех остальных моделей на том же графике. И вдвое дешевле прежней собственной связки Microsoft из трёх моделей.
Тот же приём вылезает на этой неделе с другой стороны: вышла открытая модель Neutrino-1 на 8 миллиардов параметров, сжатая тернарным форматом весов до 3,88 гигабайта. Это влезает в восьмигигабайтную видеокарту целиком, лицензия Apache-2.0, MMLU 72,1.
Складывается понятная конструкция. У вас в пайплайне есть шаги, где не нужна лучшая модель мира: классифицировать, отфильтровать, переформатировать, решить, стоит ли вообще будить старшего. Раньше туда всё равно шёл флагман, потому что возиться с двумя моделями было дороже, чем переплачивать. Сейчас дешёвый уровень стал достаточно хорош, чтобы возня окупалась.
Практический шаг простой: возьмите свой самый частый агентный воркфлоу и посчитайте, сколько вызовов в нём реально требуют сильной модели. Если больше половины — вы, скорее всего, неверно нарезали шаги, а не выбрали неверную модель.
Честности ради, цена дешёвого уровня видна сразу: Neutrino-1 в своём формате не грузится ни стоковым llama.cpp, ни Ollama, ни LM Studio — нужен их собственный форк. Экономия на токенах превращается в работу по обвязке.
https://microsoft.ai/news/introducing-mai-cyber-1-flash-inside-mdash/
Какая доля ваших вызовов реально требует топовой модели?
Post #782
277