TGViewer
Neurohive Neurohive @neurohive · 5.18K subscribers
Post #1958 3.28K
🤔 VibeThinker: 3B-модель рассуждает и кодит на уровне DeepSeek V3.2, GLM-5 и Gemini 3 Pro

Команда Sina Weibo AI опубликовала VibeThinker-3B — компактную языковую модель, которая на задачах математики и программирования показывает результаты уровня флагманских моделей DeepSeek V3.2, GLM-5 и Gemini 3 Pro, при этом уступая им в размере в 200+ раз. Код и веса модели опубликованы на Github и HuggingFace.

Авторы сформулировали гипотезу о параметрическом сжатии: одни способности моделей сжимаемы, другие нет. Верифицируемые рассуждения относятся к первым — алгоритм решения универсален и повторяем, его можно плотно уложить в небольшое число параметров. Энциклопедические знания относятся ко вторым: каждый факт, понятие и редкий сценарий требует отдельного места, поэтому здесь масштаб по-прежнему важен. Оказалось, что 3B параметров достаточно, чтобы войти в топ на специализированных задачах рассуждения.

VibeThinker-3B обучена поверх Qwen2.5-Coder-3B в четыре этапа. SFT в две ступени: сначала широкое покрытие доменов, затем фокус на длинных и сложных примерах. Многодоменный RL последовательно по математике, коду и STEM. Офлайн self-distillation лучших траекторий обратно в модель и финальный Instruct RL для следования инструкциям. На этапе RL используется MGPO — модификация GRPO, которая назначает высокие веса запросам, где модель отвечает правильно примерно в 50% случаев. Такие запросы находятся на текущей границе возможностей модели и дают наиболее полезный градиентный сигнал.

Результаты на бенчмарках с рассуждениями впечатляют. На AIME 2026 модель набирает 94.3 — столько же, сколько DeepSeek V3.2 (671B) и Kimi K2.5 (1T), с CLR (техникой проверки ключевых утверждений на этапе инференса) результат растёт до 97.1. На LiveCodeBench v6 — 80.2 Pass@1, на LeetCode соревнованиях апреля-мая 2026 решает 96.1% задач с первой попытки, выше GPT-5.2 (95.3%) и всей линейки Claude 4.6. На IFBench 74.5 — выше Claude Opus 4.5 (58.0) и Gemini 3 Pro (70.4). На вопросно-ответном GPQA-Diamond заметно отставание: 70.2 против 90+ у крупных моделей, что авторы считают подтверждением гипотезы.

#Stateoftheart
  • 🔥 10
  • 👍 4
  • 👏 3
  • ❤ 2
More from @neurohive
  1. Sep 24, 2026RRSI: метод рекурсивного самоулучшения обвязки ИИ-агентов от Google улучшил результаты Cla…
  2. Sep 19, 2026Vidu S2: модель генерирует видео-аватары и редактирует стримы на лету в 720p при 25–42 FPS…
  3. Sep 9, 2026WorldSculpt: модель собирает 3D-сцену с сотнями отдельных объектов из видео Alaya Lab и То…
  4. Aug 31, 2026🗣 VoiceMem: фреймворк памяти для голосовых ассистентов поднимает факты из всех прошлых ди…
  5. Aug 24, 20264DAnyone: 4D-модель человека из видео, снятого одной камерой Исследователи из Zhejiang Uni…
  6. Aug 11, 2026JoyAI-Video-Edit: 16B-модель редактирует видео в реальном времени при 30 FPS в 720p на одн…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →