Сегодня выпустили нашу open-source finetune версию Mistral-Small-24B-Instruct-2501 (она же Mistral Small 3).
Главная цель - адаптация на русский язык.
Модель натренирована на датасете GrandMaster-Pro-MAX и показывает
0.518 по MERA и 87.43 на LLM Arena: Arena-Hard-Auto(заняв там почетное 11 место).Это был наш первый опыт тюнинга базовых моделей на русский язык. Мы обошлись только SFT стадией, но уже ясно, что результаты можно улучшить с помощью DPO и дополнительных датасетов. Как-нибудь займусь этим.
📚Модель доступна на huggingface:
- Merged 16-bit - оригинал в формате safetensors
- LoRa adapter for mistralai/Mistral-Small-24B-Instruct-2501
- F16 GGUF
- BF16 GGUF
- Q8_0 GGUF
Важным бонусом является то, что #LLM модель после тренировки всё ещё умеет делать Function calling.
Ставьте 🔥 и я расскажу, как из неё сделать карманную reasoning-модель по типу o1/r1.
Такие дела ^_^

