🍏 Apple на короткое время опубликовала, а затем быстро удалила статью на arXiv - но версия v1 уже разошлась, и она очень любопытная.
Команда раскрыла RLAX - масштабируемый фреймворк обучения с подкреплением для LLM на TPU.
Что внутри RLAX:
- Архитектура parameter server
- Центральный тренер обновляет веса
- Огромные inference-флоты подтягивают веса и генерируют rollouts
- Оптимизировано под preemption и массовый параллелизм
- Специальные техники курирования данных и alignment
Результаты впечатляют:
- +12,8% к pass@8 на QwQ-32B
- Всего за 12 часов 48 минут
- Использовано 1024 TPU v5p
Что интерсеного:
- Apple явно экспериментирует с RL на очень больших масштабах
- TPU-ориентированная архитектура говорит о фокусе на эффективность, а не только на модель
- Прирост достигается не «магией модели», а инженерией системы обучения
- Это еще один сигнал, что RL для LLM переходит в фазу индустриальных пайплайнов
Название статьи:
RLAX: Large-Scale, Distributed Reinforcement Learning for
https://arxiv.org/pdf/2512.06392v1
Post #1295
1.8K

- ❤ 6
- 👍 6
- 🔥 3