immers.cloud — облачный GPU-сервис с широким выбором видеокарт для ML, генеративных моделей, 3D и рендеринга.
Самый большой ассортимент GPU Tesla и RTX 💻
👉 Наш сайт https://immers.cloud/
🎧 @immerscloudsupport
Чат по ИИ - https://t.me/immersAI
Post #495
981

Создаем свой Chain-of-Thoughts датасет с DeepSeek R1
Этот текст — краткая практическая рекомендация для разработчиков, которые хотят использовать открытую модель рассуждений DeepSeek R1 для генерации собственного синтетического датасета. Такой датасет позволит выполнить Chain-of-Thoughts файнтюнинг на весах любой базовой модели и, в конечном счете, создать собственную LRM, подобную DeepSeek.
1️⃣ Подготовка сервиса для генерации данных
Для начала необходимо развернуть сервис для генерации синтетических данных путем инференса модели DeepSeek. Уже есть готовые решения, например, synthetic-data-generator.
По умолчанию это приложение использует Llama-3.1-8B-Instruct, но если вам нужен DeepSeek, то:
— Разверните код генератора на GPU-сервере (это вы можете сделать на нашей платформе immers.cloud)
— В конфигурации замените переменную MODEL_COMPLETION на DeepSeek
2️⃣ Выбор модели
Выбор модели зависит от бюджета:
— Оптимальный вариант: развернуть дистиллированную версию, например, deepseek-ai/DeepSeek-R1-Distill-Qwen-32B — это более бюджетное решение
— Альтернативный вариант: развернуть веса DeepSeek R1 (как я показывал в недавнем видео) — это даст наилучшее качество
3️⃣ Настройка генерации данных
После развертывания сервиса можно задать системный промпт, который определит домен вашего датасета.
Например:
Затем настройте ключевые параметры:
— Количество строк в датасете
— Число пар вопрос-ответ в каждом диалоге
Зачем это нужно?
Этот генератор — мощный инструмент для быстрого создания наборов данных, который облегчает рутину ML-разработчиков.
📢 В следующем посте разберем, как файнтюнить веса на синтетическом CoT-датасете!
Этот текст — краткая практическая рекомендация для разработчиков, которые хотят использовать открытую модель рассуждений DeepSeek R1 для генерации собственного синтетического датасета. Такой датасет позволит выполнить Chain-of-Thoughts файнтюнинг на весах любой базовой модели и, в конечном счете, создать собственную LRM, подобную DeepSeek.
1️⃣ Подготовка сервиса для генерации данных
Для начала необходимо развернуть сервис для генерации синтетических данных путем инференса модели DeepSeek. Уже есть готовые решения, например, synthetic-data-generator.
По умолчанию это приложение использует Llama-3.1-8B-Instruct, но если вам нужен DeepSeek, то:
— Разверните код генератора на GPU-сервере (это вы можете сделать на нашей платформе immers.cloud)
— В конфигурации замените переменную MODEL_COMPLETION на DeepSeek
2️⃣ Выбор модели
Выбор модели зависит от бюджета:
— Оптимальный вариант: развернуть дистиллированную версию, например, deepseek-ai/DeepSeek-R1-Distill-Qwen-32B — это более бюджетное решение
— Альтернативный вариант: развернуть веса DeepSeek R1 (как я показывал в недавнем видео) — это даст наилучшее качество
3️⃣ Настройка генерации данных
После развертывания сервиса можно задать системный промпт, который определит домен вашего датасета.
Например:
Ты — помощник для решения технических задач из области программирования и математики.
Затем настройте ключевые параметры:
— Количество строк в датасете
— Число пар вопрос-ответ в каждом диалоге
Зачем это нужно?
Этот генератор — мощный инструмент для быстрого создания наборов данных, который облегчает рутину ML-разработчиков.
📢 В следующем посте разберем, как файнтюнить веса на синтетическом CoT-датасете!
@ruslandevlive — мысли о современных AI/ML-технологиях
- ⚡ 3
- ❤ 2
- 🎉 2
- 👍 1



















