Вот, например, еще в 2017 год в DeepMind (это компания, которая наделала шороху чуть ранее, выиграв в Alpha Go. Они сделали симуляцию - это была такая игра, в которой агенты должны были собирать яблоки.
Суть в том, что они не знали, что имеют дело с яблоками, поэтому на самом деле агенты были заинтересованы в сборе зеленых квадратиков, символизирующих яблоки. Квадратики, когда их “съедали” - появлялись новые. Виртуальные яблоки “рождались” снова через некоторое время.
В этой игре было несколько агентов (роботов, если хочешь), которые одновременно находились в определенной среде и учились, как вести себя в конкретной среде, чтобы максимизировать свою функцию для поедания максимального количества яблок.
Такие простые были правила. Проблемой было то, что эпизоды, в которых играли эти агенты, были ограничены. Допустим, каждый эпизод длился 2 или 3 минуты, и теперь: как агент должен вести себя, чтобы за эти три минуты съесть максимальное количество яблок.
Что было интересно, агенты также могли временно выбывать из игры. Они могли использовать так называемый лазер, с помощью которого, если агент был поражен, скажем, он уходил в угол на несколько секунд, то есть терял время, в течение которого мог бы собирать яблоки. В этом заключались правила этой игры.
Какой был результат. Как только появлялся дефицит ресурсов - агенты начинали идти по сценарию два - друг друга убивать. Когда же было изобилие (сценарий 1), тогда не было необходимости драться и жили они дружно.
Кстати, вот тут можно почитать публикацию DeepMind: Multi-agent Reinforcement Learning in Sequential Social Dilemmas
(Часть2)
Post #358
844