В студенческие годы я много и с упоением играл в первый StarCraft, также пытался осваивать пресловутый «скилл». Это классическая стратегия в реальном времени с добычей ресурсов, строительством и микроконтролем каждого военного юнита. С точки зрения теории управления — это абсолютно неправильно, ибо неэффективно. Но именно этот аспект вывел StarCraft и его вторую часть в пантеон киберспорта, поскольку идея повесить всё на игрока открывает широченный простор для развития мастерства.
В моменты неудач мне очень хотелось, чтобы все хитрые тактические манёвры вроде мутастека, ривердропа и прочие хит-н-раны, твои юниты выполняли сами. Однако при всём желании разработчики не смогли бы научить компьютерных болванчиков чему-либо сложнее движения с атакой или патрулирования, потому что написать алгоритм для хитрого тактического манёвра, который учтёт контекст ситуации и при этом влезет в оперативную память компьютеров начала 00-х, было технически невозможно.
Сегодня машинное обучение полностью меняет правила игры. Активно развиваются алгоритмы многоагентного планирования пути и действий — и их отрабатывают, представьте себе, в StarCraft! Ну, точнее, в специальной среде SMACv2 на базе второй части игры, где исследователи сами задают сценарии битвы (на видео к посту TvT-скирмиш в этой среде), но тем не менее. Разумеется, не старкрафтом единым, есть ещё куча сред, например, футбольный симулятор GRF.
К сожалению, многоагентная модель, обученная на одной среде, будет слаба, а то и вовсе бесполезна в другой. Мои коллеги из AIRI сделали большой шаг в создании универсальных моделей, используя архитектуру трансформер. Получившаяся модель под названием MARL‑GPT обучалась с подкреплением на датасетах из трёх разных сред: SMACv2, GRF и среде с лабиринтами POGEMA, и показала достойные результаты.
Подробности работы рассказала сегодня у нас в блоге на Хабре один из членов команды Мария Нестерова.
Post #892
654
- ❤ 9
- 👍 7
- 🔥 5
- 🍓 3