Это наша вторая Open-Source LLM. Сделано на базе Mistral-Small-3.1-24B-Instruct-2503.
Модель адаптирована под русский язык. Fine-tune осуществлён на основе Big Russian Dataset и приватного датасета проекта Школково онлайн.
Модель умеет в простейший Reasoning и любопытно показывает себя в математике.
Контекст оригинальной модели сохранён - 128k.
Трейн происходил на 8x H200 GPU в течении 29.5 часов.
🕺 MERA Score:
0.623Результаты бенчмарка сейчас на модерации, но уже видно, что по рейтингу MERA мы обогнали первый GigaChat Max, RuAdapt Qwen, T-lite-it-1.0. По сути, в своём размере мы там единственные и уже стоим рядом с моделями 32B-72B.
Бенчмарки бенчмарками, но для наших задач модель подходит других доступных остальных открытых в подобном размере.
Zero-Mistral-24B мы теперь используем в качестве базовой в наших проектах, в особенности в предстоящих публичных ИИ-фичах платформы 🖌Школково.
Размер 24B позволяет запускать её с достойным качеством на RTX 4090 в GGUF. А на RTX 5090 запускается даже в Q8_0.
При создании модели пострадала не одна пачка пельменей...
Также я подался на доклад Turbo ML Conf от Т-Банка, но они передвинули сроки ответа с 18 апреля на 25 апреля, а со мной до сих пор не связались. В рамках доклада также хотелось бы рассказать, как и зачем мы, небольшое агентство, вообще создавали эту модель. Так что если у кого-то есть контакты в Т-Банк AI, и наша история вам кажется интересной - пинганите их как-нибудь.
🤗 Модель на HuggingFace: https://huggingface.co/ZeroAgency/Zero-Mistral-24B
GGUF в различных вариантах: https://huggingface.co/ZeroAgency/Zero-Mistral-24B-gguf
