OpenAI релизнули (и вроде даже можно дергать через API) InstructGPT – сетку, которая должна лучше считывать интент пользователя, то есть генерировать что-то более специфичное вроде объяснения/саммари/парафраза/что попросят. До это уже можно было колдовать с промтами, но авторы приводят графики с доказательствами, что качество тут все же выше
Как Jan Leike сам пишет в твиттере, там не чтобы новые методы или модель: через краудсорс куча человек написало ответы к промтам, на это натюнили GPT-3, потом ответы GPT-3 также краудсорсеров попросили проранжировать. Дальше с помощью этих размеченных данных учат модель с помощью RL, кокретно через Proximal Policy Optimization (PPO). Если кратко суть PPO в том, чтобы повышать вероятность выбора действий, которые дают больше выгоды (reward), чем изначально ожидалось (такие изначальные оценки полезности получаются из отдельной MLP сетки), и понижать для тех, что оказались хуже. Но при этом нужно учитывать, что это действие приносит такую большую (или наоборот такую отрицательную) пользу только на этом участке игры, поэтому сильно уходить от текущей стратегии может быть глупо, и вообще можно так вылететь в плохой стейт, где все действия нас особо никуда не ведут, и в нем застрять, – поэтому выше и ниже определенного порога веса апдейтнуть нельзя. Если хочется подробнее, вот отличное и математичное объяснение интуиции за PPO
В целом конечно underwhelming ситуэйшн так как основной понт тут в краудсорсе, но как утверждает все тот же Jan Leike, модель научилась хорошо генерализироваться – например, выполнять задачи на других языках помимо английского или объяснять код, хотя код и тексты на других языках составляют очень небольшой процент тренировочных данных. Это как будто круто для генерализации для всяких не-conversational чатботов, от которых требуются конкретные действия/ответы, и как будто отсюда легко натюнить бота под конкретные задачи, чтобы он был не совсем retrieval-based, то есть не просто дергал ответы из базы знаний. Но все равно ы
Post #806
2.04K