TGViewer
Machinelearning Machinelearning @ai_machinelearning_big_data · 278K subscribers
Post #9957 22.5K
🌟 Ai2 представил способ обновлять навыки LLM по одному, без полного ретрейна

Институт Аллена выпустил BAR - рецепт посттрейна, в котором доменные эксперты обучаются по отдельности, а затем собираются в единую MoE-модель через обучаемый роутер.

Метод снимает давнюю проблему: как добавить модели новый навык, не переобучая её целиком и не разрушая то, что она уже умела.


Замена код-эксперта на версию, обученную на более качественных данных с RL, даёт +16.5 пунктов на кодинге при почти нулевом влиянии на другие домены. Добавление RL к существующему math-эксперту - +13 пунктов.

Стоимость обновления одного домена масштабируется линейно, а не квадратично, как в монолитном пайплайне, где любое улучшение требует прогона всех доменов заново

Основа BAR - прогрессивное размораживание общих параметров по стадиям. На mid-training они остаются заморожены, а на этапе SFT размораживаются эмбеддинги и хэд: без этого эксперт не умеет вводить новые специальные токены (например, для вызова функций).

На RLVR размораживается всё, включая внимание. Каждый эксперт при этом учится на смеси доменных и общих SFT-данных: чистый доменный SFT ломает следование инструкциям и общие знания.

После обучения эксперты сливаются простым усреднением разошедшихся общих параметров, а роутер дообучается на стратифицированной 5%-й выборке SFT-данных.

Тестовая модель BAR-5x7B на основе Olmo 2 7B с экспертами по математике, коду, tool use и безопасности набирает 49.1 балла против 47.8 у монолитного переобучения на стадии посттрейна и 46.7 у BTX, где эксперты обучаются как полностью независимые плотные модели.


Ai2 выложил полный набор чекпоинтов, на которых валидировался метод: исходную 7B-модель как точку старта, базовый двухэкспертный MoE, а также промежуточные и финальные версии доменных экспертов - по математике и программированию в двух вариантах (после SFT и после SFT+RLVR), плюс экспертов по tool-use и безопасности, обученных только через SFT. Завершает набор итоговая пятиэкспертная MoE-модель с обученным роутером, объединяющая все домены.


📌Лицензирование: Apache 2.0 License.


🟡Набор моделей
🟡Arxiv
🖥GitHub


@ai_machinelearning_big_data

#AI #ML #LLM #Train #BAR #Ai2
  • 🔥 58
  • 🤓 32
  • 👍 13
  • 👏 12
  • ❤ 9
  • 💯 5
  • 😁 1
More from @ai_machinelearning_big_data
  1. Oct 9, 2026✔️ OpenAI начала развёртывание GPT-6 с динамическим интерфейсом Главное новшество – систем…
  2. Oct 9, 2026📌 Кейноут Windows and Surface event На осенней презентации 7 октября Microsoft рассказала…
  3. Oct 9, 2026✔️ Meta*, DeepMind и Isomorphic Labs присоединились к проекту симуляции живых клеток Неком…
  4. Oct 8, 2026✔️ Организатора схемы накрутки ИИ-музыки приговорили к 18 месяцам тюрьмы Федеральный суд С…
  5. Oct 8, 2026📌Baseten выпустила бесплатный учебник по инженерии инференса Платформа, которая хостит мо…
  6. Oct 8, 2026✔️ Anthropic даёт стартапам год Claude Team и 1000 долларов на API Программу Claude for St…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →