TGViewer
Data Secrets Data Secrets @data_secrets · 94K subscribers
Post #7220 19.5K
SakanaAI опять светятся с интересной статьей: они предлагают новый способ обучать модели ризонингу

Модели умеют размышлять благодаря обучению с подкреплением. Обычно это выглядит так: модель учится решать сложные задачи, рассуждая, и получает вознаграждение, если приходит к правильному ответу. При этом часто после этого знания такой модели-учителя используются (дистилляция или cold start) для обучения модели-ученика, которая и становится конечным продуктом. Так было, например, с R1.

Sakana же предлагают обучать модель-учителя непосредственно учить других, вместо того, чтобы выучивать что-то самой:

➖ Во время обучения модель-учитель видит уже не только задачи, а сразу задачи с решениями. Ее цель – не научиться их решать, а максимально понятно объяснить решение ученику. Ну, то есть, реально отработать как обычный школьный учитель.

➖ При этом эти Reinforcement-Learned Teachers (так называется метод) получают награду, соответсвующую тому, насколько хорошо ученик их понял. Понимание оценивается с помощью лог-распределения вероятностей токенов на выходе у ученика.

➖ Таким образом модель-учитель обучается максимизировать ясность своих объяснений, и параллельно с этим (а не на следующем этапе) мы сразу обучаем конечную модель-ученика.

Во-первых, это получается быстрее и дешевле, потому что в качестве учителя уже не обязательно использовать огромную и супер-умную модель.

Во-вторых, тесты показывают, что такие учителя учат ризонингу лучше. На примере Qwen 7B и 32B на графике 2 видно, что прирост от RLT выше, чем от обучения с DeepSeek R1.

Пожалуй, самая интересная работа по RL за последнее время. Почитать полностью можно тут. Код и веса обученных моделей, кстати, тоже открыли.
  • ❤ 156
  • 🔥 44
  • ⚡ 19
  • 👍 13
  • 🤯 7
  • 😁 2
  • ❤‍🔥 1
More from @data_secrets
  1. Sep 21, 2026Вышел Grok-4.7 Кратко: – По уровню: как будто чуть лучше Sol на кодинге и агентских задача…
  2. Sep 21, 2026Дженсен Хуанг: «Прежде чем придумывать новые законы и регуляции для ИИ, нужно сначала прим…
  3. Sep 21, 2026Яндекс открыл веса новой языковой модели AliceAI-Foundation-80B-A3B-Base Модель обучена по…
  4. Sep 21, 2026Post #9975
  5. Sep 21, 2026Трамп собрался переименовать Artificial Intelligence в один из других, «более подходящих»…
  6. Sep 20, 2026Теперь у нас есть Nano Banana 2.0 дома! Alibaba выпустили в опенсорс Qwen-Image-2.1: генер…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →