TGViewer
Нейролента Нейролента @nairolenta · 21 subscribers
Post #263 5
🧠 Occamy-1.0: 35B модель для совместной работы нацелилась на низкую стоимость эпизода

Occamy-1.0 — новая модель на 35 млрд параметров, оптимизированная не под пиковые показатели на тестах, а под экономику длинных задач совместной работы. База — Qwen3.6-35B-A3B: из 35 млрд параметров на один токен активируются только 3 млрд, что радикально снижает стоимость вывода при сохранении широких возможностей для работы в роли агента. Это MoE-архитектура. Авторы собрали данные, основанные на выполнении задач, и воспроизводимые траектории длинных сценариев, затем провели поэтапное дообучение для развития координации, восстановления и удержания состояния. На четырёх репрезентативных тестах Occamy-1.0 занимает выгодную точку на кривой Парето по соотношению стоимости и качества, то есть конкурирует с существенно более крупными системами при меньшей стоимости. Веса и часть обучающих данных открыты для исследований.

→ База: Qwen3.6-35B-A3B, 35B всего, 3B активных
→ Дата выхода: 4 сентября 2026
→ Оценка: 4 теста, выгодная точка на кривой Парето по стоимости
→ Данные: траектории, основанные на выполнении задач, открыты веса и подмножество данных

Смещение фокуса с пикового качества на совокупную стоимость полного рабочего эпизода — это правильный ход для совместной работы, где модель вызывается десятки раз. Но выгодная точка по стоимости на четырёх выбранных тестах — это обещание, а не доказательство: независимые тесты на удержание контекста после более чем 10 шагов и стабильность кода покажут, насколько модель реально пригодна для промышленного использования, а не для демонстрации на трёх примерах.

arXiv:2609.11977

#Occamy #co_work #MoE #openweights #агенты
More from @nairolenta
  1. Sep 25, 2026🧠 От ELIZA к Transformer: как чаты учились диалогу В 1966 году ELIZA имитировала психотер…
  2. Sep 25, 2026🛠 Выбор модели для 2× DGX Spark: память и кэш префиксов Три свежие модели — DeepSeek-V4.1…
  3. Sep 25, 2026🛠 NVIDIA Warp и MJWarp: как запустить тысячи симуляций для обучения роботов MJWarp (MuJoC…
  4. Sep 24, 2026🛠 MCP не был плохой идеей — он решает совсем другую задачу Вопрос «MCP всегда был плохой…
  5. Sep 23, 2026🚀 Jev от TypeSafe AI — LLM, который отвечает числами TypeSafe AI представила Jev — первую…
  6. Sep 23, 2026📊 За 11 недель агент нашёл 77 ошибок, человек — 16 Одиннадцать недель автор статьи на Hab…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →