non-acyclic-gfn
В репозитории опубликован код для воспроизведения результатов работы по GFlowNets в неациклических средах. Авторы упрощают теорию для дискретного случая и показывают, как корректно определять потоки состояний и рёбер, когда траектории могут иметь произвольную длину, а классические допущения DAG не выполняются. Также уточняются связи с энтропийно-регуляризованным обучением с подкреплением, что расширяет мост между GFlowNets и RL за пределы ациклических задач. Авторами предложена простая конструкция потоков через ожидаемое число посещений, обеспечивающая детальный баланс и совпадение наград, а также показано, что при фиксированной обратной политике устойчивость лосса не влияет на оптимум, а при обучаемой — минимизация ожидаемой длины траектории эквивалентна минимизации суммарного потока, для чего вводится регуляризация по потокам состояний. Работа может быть полезна исследователям в области генеративных моделей и обучения с подкреплением.
статья | код
Post #123
690