Цербера отвлекли пылинкой
Учёные из Университета Флориды показали неприятный фокус. Если изменить в изображении буквально несколько пикселей так, что человек разницы вообще не увидит, некоторые ИИ-чатботы начинают отвечать на вопросы, которые должны были жёстко блокировать.
Для специалистов это разновидность так называемых adversarial attacks — атак через почти незаметные изменения входных данных. Про них в машинном обучении говорят уже много лет, но теперь выясняется, что старый трюк прекрасно работает и против современных мультимодальных моделей, которые одновременно понимают текст и картинки.
Вопрос, который я не хочу закрывать за тебя: если охрана падает от пылинки, кого мы на самом деле успокаиваем этим забором? Тех, кто внутри, или себя снаружи? 🙂
ИИ что дальше? Подпишись, да пребудут с тобой токены!
Post #2892
205

- 🤔 1
- 🎉 1
- 🤩 1
- 😍 1
- 😎 1