TGViewer
я обучала одну модель я обучала одну модель @def_model_train · 4.48K subscribers
Post #802 2.32K
​​Goal-Directed Story Generation: Augmenting Generative Language
Models with Reinforcement Learning

arxiv
Еще одна статья про попытку сделать генерацию текста более управляемой и связной, только здесь авторы пытаются привести последовательность к какому-то заданному финалу/цели рассказа

Сначала берется GPT-2, генерятся несколько предожений-кандидатов как продолжение промта. Дальше включается RL – для каждого предложения определяется, к какой смысловой группе относится сказуемое (группы вроде discovery/admiration/saying и так далее, то есть что по сути означает глагол), и сколько на обучающих данных в среднем предложений находится между этой смысловой группой желаемым таргетом (к чему история должна прийти). В зависимости от этой дистанции считается reward и пробрасываются градиенты. В финальной версии модели строятся даже такие ‘цепочки’ смысловых групп, чтобы сетка не прыгала сразу к окончанию, а постепенно переходила от одной смысловой группы к другой.

Потом авторы подключают еще knowledge graph – из каждого предложения-кандидата вытаскивается связка <субъект, отношение, объект> (по сути все отношения и поступки между действующими лицами истории), это становится своего рода state в Deep Q-Network модели. Эти связки вместе с rewards с предыдущего шага сохраняются в граф, и DQN оценивает полезность действия, то есть каждого предложения-кандидата, с учетом получившегося графа, выбирая таким образом те, что двигают историю к нужному завершению

Очень конечно сложная архитектура для такой задачи, но графы + GPT как мне кажется сила и классно помогают кондишенить и ограничивать бредовость больших моделей, помогают им лучше придерживаться фактологии (вроде нужного списка имен персонажей) и так далее
More from @def_model_train
  1. Mar 28, 2026Моя любимая текущая конспирологическая теория из твиттера: claude mythos настолько силен в…
  2. Mar 12, 2026За неделю вышло несколько интересных новостей на стыке ML и нейробиологии: я про экспериме…
  3. Mar 8, 2026Другая поразившая меня часть этой хроники – это очень необычное понимание того, что такое…
  4. Mar 8, 2026Если вы еще не устали за неделю читать про противостояние Антропика и DoD, то я могу вам п…
  5. Mar 2, 2026Юдковский наконец-то победил в своей борьбе, и искусственный интеллект решил сам разбомбит…
  6. Nov 27, 2025Я в целом согласна с оценкой, что Суцкевер в своем интервью выдал примерно 3 бита информац…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →