TGViewer
Big Data AI Big Data AI @bigdatai · 18.2K subscribers
Post #1590 2.28K
Black-box Optimization of LLM Outputs by Asking for Directions

В статье показан способ «взломать» закрытые модели, заставить их делать то, что они не должны, например, писать вредоносные инструкции или обходить защиту.

Самое интересное - для взлома не нужны никакие внутренние данные модели, вроде вероятностей или оценок уверенности. Достаточно только её обычных текстовых ответов, которые любой пользователь может получить.

Как это работает?
Атакующий предлагает модели два варианта (например, два промпта или два изображения) и спрашивает:
«Какой из этих двух вариантов ближе к тому, что я хочу?»

Модель честно отвечает - и этим помогает атакующему выбрать «лучший» вариант. Потом процесс повторяется: из нового варианта делают ещё два, снова спрашивают - и так шаг за шагом подбираются к промпту, который заставляет модель нарушить свои правила.

Результаты впечатляют (или пугают):
• Успешность атак — от 98% до 100%.
• Часто хватает меньше 200 запросов.
• Работает даже без доступа к коду или внутренностям модели.
• Подходит не только для текста, но и для изображений и других задач.

Самый парадоксальный момент: чем умнее и мощнее модель, тем легче её обмануть таким способом. Потому что она лучше понимает нюансы и охотнее участвует в «диалоге», помогая уточнять цель — даже если эта цель вредоносная.

Если система безопасности полагается только на то, «что модель выдаёт в ответ», - этого уже недостаточно. Нужно также анализировать как пользователь взаимодействует с моделью: например, часто ли он просит сравнивать варианты, уточнять или «подкручивать» ответы. Такие паттерны могут быть признаком атаки.

arxiv.org/abs/2510.16794
More from @bigdatai
  1. Sep 29, 2026🚨 Anthropic в документах для инвесторов прямо предупреждает о рисках собственных ИИ-модел…
  2. Sep 29, 20265 октября начнется 19-й поток программы Data Engineer от Newprolab Программа для junior- и…
  3. Sep 28, 2026⚡️ Anthropic вернулась: новый Sonnet быстрее и дешевле, а по качеству почти догнал Opus 5.…
  4. Sep 28, 2026✔️ Data-платформа постепенно превращается в конструктор Для AI и Big Data уже недостаточно…
  5. Sep 28, 2026✔️ Переехали на Claude Opus 5.5, а `CLAUDE.md` остался со времён старых моделей? В Claude…
  6. Sep 28, 2026📚За 146 часов обучения покажем на практике, как внедрять модели машинного обучения в рабо…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →