TGViewer
Machine learning Interview Machine learning Interview @machinelearning_interview · 30.3K subscribers
Post #2411 4.08K
Apple на короткое время опубликовала, а затем быстро удалила статью на arXiv - но версия v1 уже разошлась, и она очень любопытная.

Команда раскрыла RLAX - масштабируемый фреймворк обучения с подкреплением для LLM на TPU.

Что внутри RLAX:
- Архитектура parameter server
- Центральный тренер обновляет веса
- Огромные inference-флоты подтягивают веса и генерируют rollouts
- Оптимизировано под preemption и массовый параллелизм
- Специальные техники курирования данных и alignment

Результаты впечатляют:
- +12,8% к pass@8 на QwQ-32B
- Всего за 12 часов 48 минут
- Использовано 1024 TPU v5p

Почему это важно:
- Apple явно экспериментирует с RL на очень больших масштабах
- TPU-ориентированная архитектура говорит о фокусе на эффективность, а не только на модель
- Прирост достигается не «магией модели», а инженерией системы обучения
- Это еще один сигнал, что RL для LLM переходит в фазу индустриальных пайплайнов

Название статьи:
RLAX: Large-Scale, Distributed Reinforcement Learning for

https://arxiv.org/pdf/2512.06392v1
  • ❤ 22
  • 👍 10
  • 🥰 1
More from @machinelearning_interview
  1. Sep 27, 2026🚨 OpenAI-агенты более 16 000 раз атаковали сайт ООН запросами ради обычных публичных данн…
  2. Sep 26, 2026🚀 LongCat-2.5-Preview: 1.6 трлн параметров и контекст на 1 млн токенов Вышла LongCat-2.5-…
  3. Sep 25, 2026Сингулярность
  4. Sep 25, 2026📋 Китай впервые обошёл США по числу ведущих ИИ-исследователей По данным нового исследован…
  5. Sep 25, 2026Пользователь смотрит видео, листает клипы, ставит лайки — каждое действие становится сигна…
  6. Sep 25, 2026🛡️ Microsoft открыла skill для автоматического поиска рисков в AI-агентах Новый run-asser…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →