Goal-Directed Story Generation: Augmenting Generative Language
Models with Reinforcement Learning
arxiv
Еще одна статья про попытку сделать генерацию текста более управляемой и связной, только здесь авторы пытаются привести последовательность к какому-то заданному финалу/цели рассказа
Сначала берется GPT-2, генерятся несколько предожений-кандидатов как продолжение промта. Дальше включается RL – для каждого предложения определяется, к какой смысловой группе относится сказуемое (группы вроде discovery/admiration/saying и так далее, то есть что по сути означает глагол), и сколько на обучающих данных в среднем предложений находится между этой смысловой группой желаемым таргетом (к чему история должна прийти). В зависимости от этой дистанции считается reward и пробрасываются градиенты. В финальной версии модели строятся даже такие ‘цепочки’ смысловых групп, чтобы сетка не прыгала сразу к окончанию, а постепенно переходила от одной смысловой группы к другой.
Потом авторы подключают еще knowledge graph – из каждого предложения-кандидата вытаскивается связка <субъект, отношение, объект> (по сути все отношения и поступки между действующими лицами истории), это становится своего рода state в Deep Q-Network модели. Эти связки вместе с rewards с предыдущего шага сохраняются в граф, и DQN оценивает полезность действия, то есть каждого предложения-кандидата, с учетом получившегося графа, выбирая таким образом те, что двигают историю к нужному завершению
Очень конечно сложная архитектура для такой задачи, но графы + GPT как мне кажется сила и классно помогают кондишенить и ограничивать бредовость больших моделей, помогают им лучше придерживаться фактологии (вроде нужного списка имен персонажей) и так далее
Post #802
2.32K