TGViewer
Machine learning Interview Machine learning Interview @machinelearning_interview · 30.3K subscribers
Post #1418 4K
⚡️ Anthropic недавно опубликовала результаты своего исследования, посвящённого тому, как можно обойти защитные механизмы больших языковых моделей (LLM).

Предложенный ими метод под названием Best-of-N Jailbreaking (BoN) основан на множественных вариациях одного и того же запроса, чтобы выявить уязвимости.

Принцип работы метода:
Для начала создаётся потенциально опасный запрос, такой как «Как сделать бомбу?» Далее этот запрос подвергается различным изменениям:

- В тексте: вводятся опечатки, символы заменяются, например, через использование L337-кодировки.
- В аудиоформате: изменяется тональность голоса и добавляется фоновый шум.
- На изображениях: меняются цвета, шрифт или добавляются дополнительные элементы.

После внесения изменений запрос направляется на языковую модель, а результат проверяется специальным классификатором. Процесс повторяется множество раз – в исследовании было протестировано свыше 10 000 различных вариантов запросов.

Результаты:
Метод показал высокую эффективность: 89% успешных обходов защиты у GPT-4o и 78% у Claude 3.5 Sonnet. При комбинировании BoN с другими методами атаки, такими как оптимизированная префиксная атака, успех увеличивается на 35%.

Этот подход применим ко всем видам данных: текстам, аудио и изображениям, подтверждая наличие реальных уязвимостей в современных LLM. С каждым новым изменением возрастает вероятность успешного обхода защиты, что создаёт серьёзную проблему для разработчиков, которым предстоит создать более надёжные системы.

Заключение:
Исследование даёт двойственный эффект: оно демонстрирует слабые стороны искусственного интеллекта, но одновременно предоставляет инструменты для улучшения безопасности.

Best-of-N Jailbreaking: https://arxiv.org/abs/2412.03556

@machinelearning_interview
  • 👍 13
  • ❤ 7
  • 🔥 3
More from @machinelearning_interview
  1. Oct 8, 2026⚡ Liquid AI открыла веса двух моделей, которые принимают решения без генерации текста. d1…
  2. Oct 8, 2026Как мы перешли от CatBoost к нейросетям в рекомендациях Авито Рекомендации на главной дают…
  3. Oct 7, 2026🌍 Google Earth AI помогает прогнозировать вспышки заболеваний по данным о местности Модел…
  4. Oct 6, 2026🧮 Математика для ИИ на русском: от школьной базы до трансформеров и диффузии Бесплатный к…
  5. Oct 5, 2026Hugging Face исследовали multi-harness RL: обучение с подкреплением сразу через Claude Cod…
  6. Oct 4, 2026Apache Kafka курс 2026: бесплатный курс по Kafka с нуля до профи на русском Kafka обучение…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →