У T-Банка свежий опенсорс: они показали модель T-Pro 2.0
Это их первая LLM, поддерживающая гибридный ризонинг. На бенчмарках на русском языке обходит многие модели в своей весовой категории, и в принципе приближается по общим знаниям к Claude 3.7 Sonnet и DeepSeek V3.
Немного про процесс обучения:
➖ В основе – Qwen3 32B, но с более плотной токенизацией на русском языке. За счет этого T-Pro 2.0 до трех раз быстрее Qwen на русском.
➖ Дообучали на приличном русскоязычном корпусе + на 40В инструктивных данных, где треть составляли ризонинг цепочки.
➖ Ну и RL с DPO. Тут интересный момент: для оценки качества инженеры обучили собственную ревард-модель.
Подробнее про процесс они рассказывали на Turbo ML Conf, обещают скоро выложить записи.
И кстати: инстуктивный датасет, который разработчики собирали сами для дообучения, тоже (впервые!) выложили в опенсорс. В T-Wix порядка 500к примеров, есть ризонинг и не-ризонинг части.
Веса модельки | Блогпост
Post #7423
22.1K


- ❤ 124
- 🔥 60
- 👍 32
- 😁 16
- 🗿 7
- 🤯 3