TGViewer
Data Scientist | ML & AI Data Scientist | ML & AI @datascience_tg · 3.05K subscribers
Post #111 833
❤️ Sebastian Raschka выпустил большую статью про будущее обучения языковых моделей

Кратко: эпоха простого масштабирования закончилась, теперь всё внимание на обучение с подкреплением (RL).

RLHF давно помогает моделям подстраиваться под людей, но для реального мышления этого мало. Сейчас на сцену выходит GRPO — более легкий вариант, без лишних затрат. Так обучали, например, DeepSeek-R1-Zero.

Проблема в том, что RL нередко приводит к растянутым и ошибочным ответам. Решения ищут: где-то штрафуют за длину текста, где-то пересчитывают преимущества. А DeepSeek V3 и вовсе показывает зачатки мышления без RL, только на хороших данных.

Вывод: RL нужен, но без фанатизма. Главное — грамотная комбинация техник, контроль длины и автоматическая проверка. Тогда у моделей появляется шанс действительно думать, а не просто выдавать красивые тексты.

❤️ Читать полностью тут

❤️ Data Signal
  • ❤ 2
  • 👍 2
  • 🔥 2
More from @datascience_tg
  1. Oct 9, 2026📰 Глубокий разбор RAG: от архитектуры до продакшена В статье весь пайплайн раскладывают п…
  2. Oct 9, 2026ТОП 5 каналов для тех, кто увлекается IT и хакингом ☁️ CodeGuard: PySec Edition 🤒 CodeGua…
  3. Oct 8, 2026🔖 Официальные туториалы PyTorch В подборке есть: 🫡 Основы PyTorch и torch.nn; 🫡 Compute…
  4. Oct 7, 2026🔖 Один из главных инструментов для табличного ML XGBoost — оптимизированная библиотека гр…
  5. Oct 6, 2026📰 RAG без фреймворков: руками и по шагам В разборе показывают, как собрать RAG с нуля: ча…
  6. Oct 5, 2026🔖 Быстрый градиентный бустинг для больших данных LightGBM умеет обучаться на CPU и GPU, п…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →