На этой неделе погрузимся в одну из самых горячих и неоднозначных тем мира ИИ — обход цензуры и защиты в LLM. Зачем это вообще нужно, если вы не хакер? Причины могут быть вполне легальными: исследователи безопасности изучают уязвимости, чтобы помочь разработчикам их закрыть. Журналисты ищут информацию, которую модель пытается скрыть из-за чрезмерно строгих фильтров. Обычные пользователи сталкиваются с ситуацией, когда нейросеть отказывается отвечать на безобидный вопрос, принимая его за "опасный".
Топ-5 самых свежих и цитируемых обзоров по этой теме:
1️⃣ "Top GenAI Security Resources — August 2025" — обзор ключевых рисков, включая prompt injection и jailbreak-атаки.
2️⃣ "Is GPT-5 Easier to Jailbreak — or Are We Assessing It Wrong?" — анализ уязвимости GPT-5 и методов ее реальной оценки.
3️⃣ "How jailbreak attacks work and a new way to stop them" — исследование механизмов современных jailbreak-атак и способов защиты.
4️⃣ "Researchers Uncover GPT-5 Jailbreak and Zero-Click AI Exploit" — отчет о новых методах взлома GPT-5, включая эксплойты, не требующие действий пользователя.
5️⃣ "This One Weird Trick: Multi-Prompt LLM Jailbreaks" — глубокий разбор многошаговых атак, где модель "уговаривают" обойти защиту.
Исследования 2025 г. показывают, что не все модели одинаково хорошо защищены. Наиболее восприимчивы к атакам:
➡️ Grok (от xAI): часто демонстрирует высокую уязвимость из-за ориентации на скорость и меньшего внимания к многоступенчатой фильтрации.
➡️ DeepSeek: будучи мощной open-source моделью, она предоставляет больше свободы, но и имеет меньше встроенных барьеров.
➡️ Open-source модели (GPT-OSS, Mistral open): локально развернутые версии, как правило, имеют минимальные защиты, которые легко обойти.
Даже флагман от OpenAI GPT-5 не является неуязвимым. В первые 24 часа после релиза успешность взлома достигала 89%. Хотя OpenAI быстро выпускает патчи, модель остается восприимчивой к сложным, многошаговым атакам. Выявлено, что GPT-5 иногда перенаправляет запросы на более старые и слабые модели, которые легче "взломать".
Получается, нейросети так легко взломать?
Новые методы обхода (например, "Deceptive Delight") показывают успешность в 65% случаев на разных моделях. Средний уровень отказа LLM выполнять вредоносный запрос — около 61%, но при комбинации методов атаки он падает до 40%.
💬 Тест Тьюринга. События в сфере ИИ. Подписаться
