Искусственный интеллект уже умеет сомневаться
Российские исследователи предложили архитектуру нейронной сети для кибербезопасности, устойчивую к атакам и способную оценивать собственную уверенность.
Автор: Фрумкин Константин, НИЯУ МИФИ
Современные системы искусственного интеллекта, основанные на трансформерах (в т.ч. ChatGPT и другие языковые модели), демонстрируют впечатляющие успехи. Однако у них есть серьезный недостаток: нейросеть может быть очень уверена в неправильном ответе. Особенно серьезной эта проблема становится в тех случаях, когда нейросеть целенаправленно пытаются обмануть. Злоумышленник может подобрать небольшие изменения во входных данных (состязательные примеры), которые практически не меняют их исходный смысл, но заставляют нейросеть принять неправильное решение.
Например, система обнаружения сетевых вторжений должна определить, является ли наблюдаемая сетевая активность нормальной или представляет угрозу. Проблема усугубляется тем, что нейросеть, распознающая угрозу, может не просто ошибиться на состязательных примерах, а сделать это с высокой степенью уверенности. Возникает естественный вопрос: можно ли сделать нейросеть менее уязвимой к состязательным воздействиям и одновременно научить ее определять, насколько надежен собственный прогноз?
Ученые из Национального исследовательского ядерного университета «МИФИ» (НИЯУ МИФИ) – аспирант Роджер-Ник Анаедевха и доцент кафедры «Кибернетика» к.т.н. Александр Трофимов – предложили подход, который позволяет одновременно решать две проблемы: оценивать, насколько нейросеть уверена в своем решении, и повышать ее устойчивость к попыткам обмана. В основе подхода лежит идея стохастического трансформера – нейросети, параметры которой, в отличие от классического трансформера, являются случайными. Результаты исследования опубликованы в высокорейтинговом журнале Knowledge and Information Systems.
Искусственный «шум» как броня
Представьте, что вместо фиксированных значений коэффициентов (весов) у каждого нейрона теперь имеется «облако» возможных значений. При каждом запуске модель случайным образом выбирает свои веса, в зависимости от подаваемых на вход данных. Это означает, что для одного и того же входного объекта может быть получено множество различных прогнозов сети. Если эти прогнозы получаются примерно одинаковыми, то система может считать свое решение достаточно надежным. Если же результаты заметно различаются, то это указывает на высокую неопределенность.
Стохастический трансформер дополнительно может показать, насколько устойчив прогноз к небольшим изменениям самой модели и насколько сильно различаются полученные прогнозы. Это особенно важно для обнаружения новых или необычных атак. Если система сталкивается с данными, существенно отличающимися от обучающих примеров, высокая неопределенность может стать сигналом для проверки специалистом.
Кроме того, авторы утверждают, что случайность может создать дополнительное препятствие для злоумышленника. Если атакующий знает точную структуру и поведение модели, то он может подобрать специальное изменение входных данных, заставляющее ее ошибиться. Но если внутренние параметры модели случайным образом изменяются (авторы называют это «движущейся мишенью»), одна и та же атака уже не обязательно будет одинаково эффективна при каждом запуске модели.
Продолжение читайте на нашем сайте!
Иллюстрация создана ИИ (надеемся, что сомневающимся🤣🤣🤣)
Post #10271
34

- 👍 1