TGViewer
Knowledge Accumulator Knowledge Accumulator @knowledge_accumulator · 5.69K subscribers
Post #90 1.71K
Adversarial Policies Beat Superhuman Go AIs [2023] - учимся унижать сверхчеловеческие нейросети

Оказывается, AlphaZero-подобные нейросети можно надурить! Причём, не разработав более сильного агента, а натренировав его специально против конкретного алгоритма. В то же время, этот агент будет проигрывать всем остальным, даже новичкам-людям, что показывает нетранзитивность сравнения уровня систем.

Для тренировки нам нужен доступ к нейросети-жертве - возможность получить её выход на любой вход, сами веса не нужны. Схема обучения почти такая же, как в AlphaZero - мы садим играть нейросеть против противника и учим её предсказывать исход игры и результат поиска более оптимального хода по дереву вариантов. Это итеративно улучшает качество её работы.

Отличие в том, что в данном случае противником выступает не сам обучаемый агент, а нейросеть-жертва. То есть противник и его стратегия являются полноценной частью среды с точки зрения агента, и он учится к нему приспосабливаться.

Авторы обнаружили, что нейросеть-жертва в некоторых ситуациях просто начинает пасовать, думая, что уже выиграла, хотя на самом деле на "её" территории остаётся камень противника и поэтому территория не засчитывается жертве (на картинке справа). Другая уязвимость заключается в том, что из камней можно нарисовать такой узор, от которого жертву начнёт глючить, и она проигрывает (на картинке слева). В статье много подробностей и картинок. Также интересно то, что уязвимости переносятся на другие системы, т.к. процессы тренировки и архитектуры нейросетей у современных алгоритмов во многом похожи.

Интересно, конечно, возможно ли сделать устойчивый к атакам алгоритм, модифицировав схему обучения, или это фундаментальная проблема ввиду размера пространства состояний игры.

@knowledge_accumulator
  • 🔥 14
  • 👍 8
  • ❤‍🔥 1
More from @knowledge_accumulator
  1. Sep 20, 2026Почувствуйте AGI Все эти годы я писал о том, что не верю в потенциал LLM превратиться в су…
  2. Sep 5, 2026Предсказать среднее могут не только лишь все Классическая задача машинного обучения - трен…
  3. Aug 17, 2026Долина vs Нью-Йорк Если что-то находится далеко от нас, нам свойственно излишне обобщать с…
  4. Jul 30, 2026Кто виноват в сливе рекламного бюджета? При создании рекламного line item рекламодатель ус…
  5. Jul 13, 2026Покатался на яхте в Американской глубинке После переезда в Калифорнию произошло неожиданно…
  6. Jun 30, 2026Да кто такие эти ваши producer-side A/B-тесты? В своей яндексовской эре работы над рекомен…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →