Нашел отличный гайд по обучению с подкреплением (RL) в контексте больших языковых моделей (LLM)!
Вообще, c RL связаны многие успехи LLM - это и то, что они превратились в полезных ассистентов вместо простых продолжателей текста коими были первые модели серии GPT, и стали "рассуждать" прежде чем дать ответ (начиная с o1). Так что изучить что там под капотом будет полезно многим
Ссылка: https://cameronrwolfe.substack.com/p/llm-rl
Post #22
183