Есть ли жизнь на других флангах обучающихся агентов?
Я зашёл в список статей, которые цитируют AdA, и наткнулся на забавную работу. Это хороший повод рассказать о в корне альтернативном способе обучения агентов на её примере.
Авторы пытаются позаимствовать из биологии следующий концепт - при обучении интеллектуальных систем у нас может не быть заданной извне награды, которую мы максимизируем каким-нибудь RL-алгоритмом. Вместо этого мы можем обучать агентов подобием генетического алгоритма, т.е. поддерживать популяцию параметров модели, и ввести какой-нибудь критерий отбора. Как же тут делают?
1) В качестве "среды" используется 2D-мир, в котором есть появляющаяся каким-то образом еда.
2) Наш агент - это "организм", параметризуемый нейронной сетью, принимающей на вход информацию об окружении агента и выдающей следующее действие.
3) У агента есть внутренний парамер "сытости". Он падает с каждым шагом, и поднимается, когда агент съедает что-нибудь.
4) Каждые X шагов агент, у которого сытость выше определённого уровня, размножается. Рядом с ним появляется ещё один агент с его весами и добавленным к ним нормальным шумом. Агент, у которого сытость меньше определённого уровня, исчезает.
Авторы наблюдают, что со временем агенты адаптируются к свойствам среды и обучаются тактикам работы в ней. В зависимости от разных параметров среды, например, общего количества ресурсов, агент может быть либо "кочевником" и постоянно искать новые места, либо наоборот, сторожить ресурсное место, которое он уже нашёл.
Конечно, это всё находится в весьма зачаточном состоянии. Мы всё ещё обучаем веса фиксированной архитектуры нейросети, а задача не способствует появлению какого-то интеллектуального поведения. Будем смотреть, получится ли из подобного подхода что-нибудь в будущем.
@knowledge_accumulator
Post #80
1.64K

- 👍 22