Post #90
1.71K

Adversarial Policies Beat Superhuman Go AIs [2023] - учимся унижать сверхчеловеческие нейросети
Оказывается, AlphaZero-подобные нейросети можно надурить! Причём, не разработав более сильного агента, а натренировав его специально против конкретного алгоритма. В то же время, этот агент будет проигрывать всем остальным, даже новичкам-людям, что показывает нетранзитивность сравнения уровня систем.
Для тренировки нам нужен доступ к нейросети-жертве - возможность получить её выход на любой вход, сами веса не нужны. Схема обучения почти такая же, как в AlphaZero - мы садим играть нейросеть против противника и учим её предсказывать исход игры и результат поиска более оптимального хода по дереву вариантов. Это итеративно улучшает качество её работы.
Отличие в том, что в данном случае противником выступает не сам обучаемый агент, а нейросеть-жертва. То есть противник и его стратегия являются полноценной частью среды с точки зрения агента, и он учится к нему приспосабливаться.
Авторы обнаружили, что нейросеть-жертва в некоторых ситуациях просто начинает пасовать, думая, что уже выиграла, хотя на самом деле на "её" территории остаётся камень противника и поэтому территория не засчитывается жертве (на картинке справа). Другая уязвимость заключается в том, что из камней можно нарисовать такой узор, от которого жертву начнёт глючить, и она проигрывает (на картинке слева). В статье много подробностей и картинок. Также интересно то, что уязвимости переносятся на другие системы, т.к. процессы тренировки и архитектуры нейросетей у современных алгоритмов во многом похожи.
Интересно, конечно, возможно ли сделать устойчивый к атакам алгоритм, модифицировав схему обучения, или это фундаментальная проблема ввиду размера пространства состояний игры.
@knowledge_accumulator
Оказывается, AlphaZero-подобные нейросети можно надурить! Причём, не разработав более сильного агента, а натренировав его специально против конкретного алгоритма. В то же время, этот агент будет проигрывать всем остальным, даже новичкам-людям, что показывает нетранзитивность сравнения уровня систем.
Для тренировки нам нужен доступ к нейросети-жертве - возможность получить её выход на любой вход, сами веса не нужны. Схема обучения почти такая же, как в AlphaZero - мы садим играть нейросеть против противника и учим её предсказывать исход игры и результат поиска более оптимального хода по дереву вариантов. Это итеративно улучшает качество её работы.
Отличие в том, что в данном случае противником выступает не сам обучаемый агент, а нейросеть-жертва. То есть противник и его стратегия являются полноценной частью среды с точки зрения агента, и он учится к нему приспосабливаться.
Авторы обнаружили, что нейросеть-жертва в некоторых ситуациях просто начинает пасовать, думая, что уже выиграла, хотя на самом деле на "её" территории остаётся камень противника и поэтому территория не засчитывается жертве (на картинке справа). Другая уязвимость заключается в том, что из камней можно нарисовать такой узор, от которого жертву начнёт глючить, и она проигрывает (на картинке слева). В статье много подробностей и картинок. Также интересно то, что уязвимости переносятся на другие системы, т.к. процессы тренировки и архитектуры нейросетей у современных алгоритмов во многом похожи.
Интересно, конечно, возможно ли сделать устойчивый к атакам алгоритм, модифицировав схему обучения, или это фундаментальная проблема ввиду размера пространства состояний игры.
@knowledge_accumulator
- 🔥 14
- 👍 8
- ❤🔥 1











