Scaling AI уже не сводится к «давайте добавим ещё параметров»
Основатель Zhipu Тан Цзе хорошо сформулировал, куда движется масштабирование моделей.
Вопрос «сколько параметров?» становится всё менее полезным сам по себе.
Теперь у scaling есть несколько независимых рычагов:
— число параметров
— объём данных
— compute на один forward pass
— post-training и RL
И следующий прирост качества может выгоднее получить не увеличением модели, а, например, более долгим post-training.
По мысли Тан Цзе, общий размер модели важен до определённого порога - условно, пока ей хватает ёмкости «держать мир». Дальше больше пользы может давать увеличение эффективной глубины вычисления и особенно post-training.
GLM-5.3 — практический пример этой идеи: та же базовая архитектура и те же параметры, что у GLM-5.2, но ещё месяц long-horizon environments и RL.
Post #2953
3.41K

- ❤ 11
- 👍 6
- 🔥 3