TGViewer
Complete AI Complete AI @complete_ai · 7.86K subscribers
Post #843 2.76K

Forwarded from AbstractDL

OLMo 3

Это, пожалуй, самый честный и воспроизводимый релиз года. Тут выкатили вообще всё: от исходного кода и 6T токенов (Dolma 3) до каждого промежуточного чекпоинта и точного порядка данных в батчах.

Для тех, кто занимается ресёрчем, это не просто модель, а идеальный полигон для экспериментов.

В техрепорте много «вкусного» (и спорного):

- Delta-DPO: Авторы подтвердили гипотезу, что для ризонинга важнее не качество выбранного ответа, а дельта между ним и отвергнутым. Они брали ответы от Qwen-3 32B (chosen) и сталкивали их с ответами мелкой Qwen-3 0.6B (rejected). Да, выходит off-policy, но видимо когда данных дофига, то норм. Результат: обучение на контрасте между ними работает лучше, чем классическое SFT на идеальных данных.

- OlmoRL: Они переписали инфру для RLVR, разогнав её в 4 раза. Из крутых фишек — Inflight updates (обновление весов акторов прямо во время генерации в vLLM) и Active sampling (динамический добор задач в батч, чтобы градиент не занулялся на слишком простых примерах). KL-дивергенцию из лосса просто выкинули — говорят, так стабильнее.

- Model Souping: Почти на каждом этапе (мидтрейн, лонг-контекст) авторы мерджили чекпоинты налево и направо. Выглядит так, будто основной рецепт обучения всё ещё не супер стабилен, и его приходится полировать различными костылями.

По метрикам флагманская 32B-Think получилась сильно перекошенной в математику. В ризонинге на MATH и AIME приближается к Qwen-3 32B. Но на общих знаниях (MMLU) модель немного проседает. Думаю, ценность тут не в SOTA цифрах, а в возможности увидеть весь цикл обучения изнутри.

Обучение 32B модели заняло 56 дней на кластере из 1024xH100 и обошлось примерно в $2.75M. Почти 9 дней из этого срока ушло на пост-трейнинг (SFT/DPO/RL).

Статья, GitHub
  • ❤‍🔥 12
  • 👍 5
  • 🔥 5
  • ❤ 2
More from @complete_ai
  1. Sep 17, 2026AI + разработка — Senior-разработчиков ждут в Ozon Tech В компании развивается новое напра…
  2. Sep 7, 2026Мы выложили программу Practical ML Conf 2026 Я уже не первый год состою в программном коми…
  3. Sep 5, 2026Утекли предполагаемые бенчмарки Gemini 4 - цифры выглядят безумно 🤯 В сети разошлась табл…
  4. Aug 20, 202617 сентября в Москве пройдёт AI R&D DAY — конференция для исследователей, разработчиков, р…
  5. Aug 20, 2026Сегодня вечером мы вместе с Денисом Макрушиным встретимся на стриме и разгоним базу про бе…
  6. Aug 14, 2026🔥 GLM-5.3 от Z.ai — главное за 30 секунд: Чистый post-training. Та же базовая модель —GLM…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →