TGViewer
Машинное обучение RU Машинное обучение RU @machinelearning_ru · 18.2K subscribers
Post #2908 2.91K
⚡ Новое исследование: меньше — значит лучше?

Авторы работы проверили, правда ли **Sparse Mixture of Experts (MoE)**-модели становятся лучше просто за счёт роста размера.

🔎 Сравнивали 8 открытых моделей на 10 бенчмарках в одинаковых условиях, проверяя результаты статистическими тестами.

Ключевые выводы
- 🏆 GPT-OSS 20B обошёл GPT-OSS 120B на MMLU и HumanEval.
- ⚡ 20B требует в 5 раз меньше GPU-памяти и на 2.6 раза меньше энергии на ответ.
- 20B даёт более короткие и точные ответы, а 120B часто проигрывает из-за неэффективного роутинга или обучения.
- Обе модели сильны в генерации кода, но слабы на китайских задачах.

Практическое значение
- ✅ Для английского кода и структурных рассуждений выгоднее использовать 20B — выше пропускная способность и ниже задержка.
- ❌ Для многоязычных и профессиональных доменов преимущества не так очевидны.

📄 Paper: arxiv.org/abs/2508.12461
  • 👍 6
  • ❤ 5
  • 🔥 2
  • 🥰 1
More from @machinelearning_ru
  1. Oct 1, 2026photo post
  2. Oct 1, 2026✔️ Президент США и главы ИИ-компаний подписали соглашение о безопасности Документ подписал…
  3. Sep 30, 2026🧠 Открытые нейросетевые фреймворки представили на главной конференции по рекомендательным…
  4. Sep 29, 2026Intern-Decision - новая серия компактных моделей для принятия решений по тексту и изображе…
  5. Sep 28, 2026Anthropic выпустила Claude Sonnet 5.5 - новую модель с упором на код, агентные задачи и по…
  6. Sep 28, 2026🦾 Практический RecSys: собери рекомендательную ленту с помощью ML — на бесплатном вебинар…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →