📌 Xiaomi стримит процесс RL-обучения моделей MiMo-V2.6
После полугода затишья команда инженеров Xiaomi вернулась с экспериментом по предельному масштабированию RL-обучения и вывела телеметрию кластера в публичную трансляцию.
Архитектура тренировочного процесса полностью асинхронна - на каждом шаге система берет 1568 промптов и генерирует по 16 роллаутов на каждый, обрабатывая в общей сложности порядка двух миллиардов токенов.
В рамках одного процесса разработчики смешали несколько доменов — от генерации кода и задач по кибербезопасности до мультимодального зрения и поведения чат-агентов, подключив несколько тестовых харнессов одновременно.
Дашборд отображает метрики моделей Mimo-v2.6-flash и Mimo-v2.6-pro в реальном времени, включая распределение задач, длину контекста и тайминги шагов.
Обучение модели в самом разгаре. Подробную документацию и наработки Xiaomi планирует опубликовать в открытом доступе в ближайшие недели.
@ai_machinelearning_big_data
#news #ai #ml
Post #10951
20.1K

- 🔥 131
- 👏 29
- 👍 15
- 🤓 15
- ❤ 9