TGViewer
Мысли Фединцева Мысли Фединцева @fedintsev_thoughts · 167 subscribers
Post #22 183
Нашел отличный гайд по обучению с подкреплением (RL) в контексте больших языковых моделей (LLM)!

Вообще, c RL связаны многие успехи LLM - это и то, что они превратились в полезных ассистентов вместо простых продолжателей текста коими были первые модели серии GPT, и стали "рассуждать" прежде чем дать ответ (начиная с o1). Так что изучить что там под капотом будет полезно многим

Ссылка: https://cameronrwolfe.substack.com/p/llm-rl
Substack Reinforcement Learning for LLMs: The Complete Guide Tracing the evolution of RL from first principles to the frontier of modern AI research...
  • 🔥 5
More from @fedintsev_thoughts
  1. Sep 23, 2026Я в шоке, конечно, что у нас такие репетиторы по математике... P. S. надеюсь, что это был…
  2. Sep 19, 2026Интересные новости с утра 🙂 Оказывается, наш мозг - это не один орган! Разные его части п…
  3. Sep 14, 2026ПОЧЕМУ ЛЕ КУН ОШИБАЛСЯ И Я ВМЕСТЕ С НИМ... Вступил тут в дискуссию в ФБ, которая и навеяла…
  4. Sep 2, 2026Но если у мыши препарат даёт +12.4% всей жизни и почти +70% оставшейся жизни, а наблюдаемы…
  5. Sep 2, 2026Проблема №5. «Улучшили hallmarks of aging» ≠ доказали замедление старения Уменьшился p16,…
  6. Sep 2, 2026Новости лонжевити Свеженькая, с пылу с жару статья в Nature с громким заголовком “Late-lif…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →