🐳 DeepSeek-R1-0528 — апгрейд одной из лучших открытых моделей рассуждений
DeepSeek представили новую версию своей reasoning-модели — DeepSeek-R1-0528.
Судя по бенчмаркам на странице модели, она уверенно превосходит предыдущую версию R1 в задачах на логику, математику и программирование.
Особенно впечатляет результат на AIME-бенчмарке — модель сравнялась с OpenAI o3 и Gemini 2.5 Pro, что делает её крайне интересной для разработчиков generative AI-приложений.
✍️ Как достигли такого прироста?
При её обучении увеличили глубину цепочки рассуждений — в среднем 23К токенов на вопрос по сравнению с 12К токенов у R1.
Также разработчики объявили, что в новой версии улучшена поддержка вызова функций, а инференс моделей более устойчив к галлюцинациям.
✍️ Как развернуть модель на практике?
Ранее я писал о том, как развернуть DeepSeek на immers.cloud — очевидно, придётся задействовать квантизацию, и даже в fp4 потребуется шесть видеокарт H100 для полной загрузки весов.
Для тех, кто работает с ограниченными ресурсами, команда выпустила дистиллированную версию — DeepSeek-R1-0528-Qwen3-8B.
Она обучена на reasoning-трейсах старшей модели и по результатам AIME 2024 вплотную приблизилась к Qwen3-235B — почти 30-кратное снижение параметров без значительной потери качества.
🔗 Подключайтесь, тестируйте, запускайте эксперименты — immers.cloud подходит как для ресерча, так и для продакшн-нагрузок.
@ruslandevlive — мысли о современных AI/ML-технологиях
