🤔 VibeThinker: 3B-модель рассуждает и кодит на уровне DeepSeek V3.2, GLM-5 и Gemini 3 Pro
Команда Sina Weibo AI опубликовала VibeThinker-3B — компактную языковую модель, которая на задачах математики и программирования показывает результаты уровня флагманских моделей DeepSeek V3.2, GLM-5 и Gemini 3 Pro, при этом уступая им в размере в 200+ раз. Код и веса модели опубликованы на Github и HuggingFace.
Авторы сформулировали гипотезу о параметрическом сжатии: одни способности моделей сжимаемы, другие нет. Верифицируемые рассуждения относятся к первым — алгоритм решения универсален и повторяем, его можно плотно уложить в небольшое число параметров. Энциклопедические знания относятся ко вторым: каждый факт, понятие и редкий сценарий требует отдельного места, поэтому здесь масштаб по-прежнему важен. Оказалось, что 3B параметров достаточно, чтобы войти в топ на специализированных задачах рассуждения.
VibeThinker-3B обучена поверх Qwen2.5-Coder-3B в четыре этапа. SFT в две ступени: сначала широкое покрытие доменов, затем фокус на длинных и сложных примерах. Многодоменный RL последовательно по математике, коду и STEM. Офлайн self-distillation лучших траекторий обратно в модель и финальный Instruct RL для следования инструкциям. На этапе RL используется MGPO — модификация GRPO, которая назначает высокие веса запросам, где модель отвечает правильно примерно в 50% случаев. Такие запросы находятся на текущей границе возможностей модели и дают наиболее полезный градиентный сигнал.
Результаты на бенчмарках с рассуждениями впечатляют. На AIME 2026 модель набирает 94.3 — столько же, сколько DeepSeek V3.2 (671B) и Kimi K2.5 (1T), с CLR (техникой проверки ключевых утверждений на этапе инференса) результат растёт до 97.1. На LiveCodeBench v6 — 80.2 Pass@1, на LeetCode соревнованиях апреля-мая 2026 решает 96.1% задач с первой попытки, выше GPT-5.2 (95.3%) и всей линейки Claude 4.6. На IFBench 74.5 — выше Claude Opus 4.5 (58.0) и Gemini 3 Pro (70.4). На вопросно-ответном GPQA-Diamond заметно отставание: 70.2 против 90+ у крупных моделей, что авторы считают подтверждением гипотезы.
#Stateoftheart
Post #1958
3.28K

- 🔥 10
- 👍 4
- 👏 3
- ❤ 2