TGViewer
Life-Hack - AI Life-Hack - AI @life_hack_ai · 1.9K subscribers
Post #613 337
Изображение оказалось способно взломать модели ИИ с визуальным и языковым анализом

#ai #обходзащиты #ии #джейлбрейк

Исследователи из Флоридского международного университета выяснили, что одного изображения может быть достаточно, чтобы вывести некоторые системы ИИ за пределы их встроенных средств защиты.

Они изучили, как тонкие изменения изображений могут быть использованы для манипулирования моделями ИИ. При этом для человеческого глаза такие картинки выглядят нормально. Однако для системы ИИ эти крошечные изменения на уровне пикселей могут резко изменить то, как они интерпретируются.

Команда разработала метод под названием JaiLIP (Jailbreaking with Loss-guided Image Perturbation, взлом с помощью искажения изображения, управляемого потерями). Метод вносит тщательно рассчитанные изменения в изображение, сохраняя при этом его внешний вид для глаза. Цель состоит в том, чтобы повлиять на то, как модель обработки изображений и языка реагирует на запросы пользователя.

Это различие важно, потому что системы ИИ видят изображения не так, как люди. В то время как мы распознаём объекты, цвета и сцены, ИИ обрабатывает математические представления пикселей и узоров.

В ходе тестирования с BLIP-2, мультимодальной моделью ИИ, используемой исследователями и разработчиками, команда обнаружила, что изображения JaiLIP значительно повышают вероятность небезопасных ответов. По словам исследователей, этот метод превзошёл предыдущие и почти вдвое увеличил количество вредоносных результатов, сгенерированных во время тестирования.

В качестве примера команда привела модифицированное изображение светофора. Хотя изображение казалось обычным для человека, оно, как сообщается, повлияло на модель, заставив её дать инструкции по проезду на красный свет, чтобы избежать штрафа за нарушение правил дорожного движения — информацию, которую система обычно отказывается предоставлять.

Особый интерес к этому исследованию вызывает то, что оно выявляет новую уязвимую поверхность. По мере того, как компании внедряют агентов обслуживания клиентов на основе ИИ, автоматизированные рабочие процессы и мультимодальные системы, принимающие как текстовые, так и графические данные, злоумышленникам может больше не понадобиться полагаться исключительно на подсказки для манипулирования поведением модели.

Результаты особенно актуальны для небольших организаций, которые могут использовать модели ИИ с открытым исходным кодом или развёртывать инструменты без тщательного тестирования безопасности. Изменённое изображение, загруженное через чат-бот, портал поддержки или автоматизированный рабочий процесс, потенциально может повлиять на то, как система ИИ реагирует в фоновом режиме.

Исследование также служит напоминанием о том, что модели ИИ по-прежнему воспринимают мир совсем иначе.

Life-Hack - AI
  • 👍 4
  • 🔥 3
More from @life_hack_ai
  1. Sep 24, 2026Как устроены LLM: разбираем на примере 3-уровневой абстракции #ии #ai #llm Чтобы оптимизир…
  2. Sep 23, 2026ИИ-агент как цифровой сотрудник: где возникают риски и как их ограничить #owasp #redteamin…
  3. Sep 22, 2026Post #700
  4. Sep 21, 2026ИИ для создания сайта: как сделать сайт с помощью нейросети #статья #ai #полезное Лендинг…
  5. Sep 19, 2026Что умеет ассистент по умолчанию на Android — на примере Алисы AI #статья #ai На устройств…
  6. Sep 18, 2026США не хватает до 157 тысяч человек, чтобы делать чипы для ИИ. И это не про программистов…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →