Учим модель рассуждать на русском как 🐋 DeepSeek R1 за 2 часа и $2.5
Встретился интересный пример, как можно обучить свою reasoning (думающую) модель с помощью подхода как у DeepSeek R1 — чистый RL без примеров реальных рассуждений. Пришлось основательно доработать его напильником, но в итоге завелось!
🔹 За основу взята “не-думающая” малышка Qwen2.5-0.5B
🔹 Алгоритм вознаграждения для RL очень похож на DeepSeek:
• “Хвалим” модель за правильное использование тегов <reasoning> и <answer>, за попадание в ответ.
• При этом не даём ей никаких указаний, как именно нужно рассуждать (для меня именно это — самое удивительное!)
🔹 Датасет: русскоязычный 📚 d0rj/gsm8k-ru (переводной, пары “вопрос-ответ” по математике)
🔹 Главная фишка 🚀 — обучение занимает всего пару часов на A100 (40GB), после чего модель реально начинает рассуждать на русском внутри выделенных тегов.
🔹 Где взять A100? — оплатить подписку Colab Pro ($10, из них обучение съест $2.5). Другие варианты - гранты hugging face. Смелые могут запустить на маке M-series без vllm, обучение займет 40 часов.
Это учебный пример, чтобы пощупать процесс обучения R1-like “думающих” моделей. Не ждите от модели многого — 0.5B среди LLM это, конечно, муравей 🐜. Мне до сих пор странно, что они вообще могут научиться что-то говорить.
Ссылка на Colab с работающим примером. Ссылка на исходный пример внутри.
P.S. Только сейчас заметили, что задача-то не правильно решена 🙈
UPD: Замерил качество. Результат так себе. Модель хорошо научилась вставлять свои рассуждения в теге, но на качестве ответов это никак ни сказалось.
Post #69
1.44K

- 👍 9
- 🔥 7
- 🐳 3
- 👏 2
- 😁 2