Сбер представил STARM — open-source-фреймворк для обучения рекурсивных reasoning-моделей 🚀
Решение объединило лучшие компоненты архитектур HRM, TRM и URM с собственными наработками команды:
🔘Новый подход к reasoning: гибридная архитектура повышает стабильность обучения и качество рассуждений.
🔘Новые SOTA-метрики: итоговые модели существенно опережают по качеству предыдущие open-source-аналоги.
🔘Адаптивные вычисления: модель выполняет ровно столько вычислительных шагов, сколько требует сложность задачи.
Полные результаты исследований и замеры качества доступны на Хабре.
Полный код фреймворка — в открытом доступе на GitHub
Post #1692
923

- 🔥 3