TGViewer
AbstractDL AbstractDL @abstractdl · 18.6K subscribers
Post #186 16.6K
🤗Illustrated Reinforcement Learning from Human Feedback (RLHF)

Отличный блог-пост от HuggingFace с разбором RL для файнтюна языковых моделей (webGPT, instructGPT, chatGPT).

А ещё, RLHF теперь официально поддерживается в transformers через библиотеку trl!

P.S. Сейчас все побегут учить свою mini-chatGPT в колабе)

Блог, GitHub
  • 👍 60
More from @abstractdl
  1. Sep 25, 2026Evidence of Linear Superposition in LLMs Языковые модели ЕЩЁ ЛИНЕЙНЕЕ, чем мы думали. Это,…
  2. Sep 22, 2026GPT-6-sol и luna. Куда ещё дешевле то? Демпингуют) UPD: раздали всем reset-ы лимитов
  3. Sep 22, 2026Антропик дропнули сброс лимитов, доступен до 22 октября
  4. Sep 22, 2026Opus-5.5
  5. Sep 21, 2026Grok-4.7
  6. Sep 21, 2026Замечаете, как Codex иногда неожиданно тупеет? Возможно, вместо Astra вам отвечает… Luna.…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →