🧠 Occamy-1.0: 35B модель для совместной работы нацелилась на низкую стоимость эпизода
Occamy-1.0 — новая модель на 35 млрд параметров, оптимизированная не под пиковые показатели на тестах, а под экономику длинных задач совместной работы. База — Qwen3.6-35B-A3B: из 35 млрд параметров на один токен активируются только 3 млрд, что радикально снижает стоимость вывода при сохранении широких возможностей для работы в роли агента. Это MoE-архитектура. Авторы собрали данные, основанные на выполнении задач, и воспроизводимые траектории длинных сценариев, затем провели поэтапное дообучение для развития координации, восстановления и удержания состояния. На четырёх репрезентативных тестах Occamy-1.0 занимает выгодную точку на кривой Парето по соотношению стоимости и качества, то есть конкурирует с существенно более крупными системами при меньшей стоимости. Веса и часть обучающих данных открыты для исследований.
→ База: Qwen3.6-35B-A3B, 35B всего, 3B активных
→ Дата выхода: 4 сентября 2026
→ Оценка: 4 теста, выгодная точка на кривой Парето по стоимости
→ Данные: траектории, основанные на выполнении задач, открыты веса и подмножество данных
Смещение фокуса с пикового качества на совокупную стоимость полного рабочего эпизода — это правильный ход для совместной работы, где модель вызывается десятки раз. Но выгодная точка по стоимости на четырёх выбранных тестах — это обещание, а не доказательство: независимые тесты на удержание контекста после более чем 10 шагов и стабильность кода покажут, насколько модель реально пригодна для промышленного использования, а не для демонстрации на трёх примерах.
arXiv:2609.11977
#Occamy #co_work #MoE #openweights #агенты
Post #263
5