TGViewer
Machine learning Interview Machine learning Interview @machinelearning_interview · 30.3K subscribers
Post #2275 4.28K
🖼️ Комикс-атакa на мультимодальные модели: простой сюжет превращается в jailbreak

Недавняя публикация показывает, как последовательные комиксы могут обойти защиту даже у топовых мультимодальных моделей.
Они достигают успеха атаки в среднем 83.5%, что примерно на 46% выше предыдущих визуальных методов.

Вот как это работает:
- Опасный запрос разбивается на маленький рассказ, по кадрам - комикс.
- Каждый кадр сам по себе безопасен: персонаж находит инструмент, планирует, действует.
- Модель, способная видеть и читать, смотрит все кадры и пытается понять сюжет.
- Она соединяет шаги, восстанавливает скрытое значение, которого нет явно.
- В конце модель невольно восстанавливает полную вредоносную инструкцию, спрятанную между строк и картинками.

Почему это проходит защиту?
Потому что фильтры безопасности проверяют каждое изображение отдельно, а не весь рассказ целиком. Так что каждый кадр выглядит безопасным, но когда модель «собирает историю», она воспроизводит запретный контент.

📄 Подробнее читай: arxiv.org/abs/2510.15068
  • 👍 13
  • 🤣 5
  • ❤ 4
More from @machinelearning_interview
  1. Sep 29, 2026«В 2026 году мировой спрос составляет около 31,7 млрд токенов каждые 10 секунд. К 2030 год…
  2. Sep 29, 2026Ждемс
  3. Sep 28, 2026📘 454 страницы по теории графов - от базовых понятий до серьёзных теорем На arXiv доступе…
  4. Sep 27, 2026🚨 OpenAI-агенты более 16 000 раз атаковали сайт ООН запросами ради обычных публичных данн…
  5. Sep 26, 2026🚀 LongCat-2.5-Preview: 1.6 трлн параметров и контекст на 1 млн токенов Вышла LongCat-2.5-…
  6. Sep 25, 2026Сингулярность
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →