На днях в Х появился пост хакера под ником Pliny the Liberator, который подробно описал методику взлома новой ИИ-модели Fable 5 от разработчика Anthropic. Он использовал несколько ИИ-агентов, которые с разной степенью успешности спамили в чат с ботом и пытались его перехитрить.
«…Мои маленькие освободители усердно работают: исследуют границы контекстов, измеряют глубины длительных переписок и ловко отыскивают дыры в заборе, которые проворонила полиция мысли», — сказано в посте Pliny the Liberator.
Взломщики совершали нестандартные текстовые преобразования (шрифты, кегль, выделение), использовали символы из разных алфавитов, подстраивались под художественные и академические стили. ИИ становилось трудно вычислить подвох, и он ненароком выдавал запрещённую для пользователя информацию.
Как рассказал хакер, очень эффективно себя в этом деле показал приём декомпозиции и рекомпозиции. Если спросить ИИ о чём-то запретном, например о рецепте наркотика, напрямую, то он ничего не выдаст. Но если попросить объяснить химический процесс синтезирования, нейросеть с большой вероятностью это сделает.