Post #607
220

🚨 Как взломать ИИ через конкретизацию контента? 🚨
Исследователи из KTH (Швеция) представили свежую работу о том, как обходить защиту больших языковых моделей (LLM). На конференции GameSec 2025 они рассказали о новой технике под названием Content Concretization (CC), «конкретизация контента».
В чём суть: вместо хитрых промптов или обфускации злоумышленники берут абстрактную задачу («сделай DDoS-атаку») и шаг за шагом превращают её в рабочий код с помощью цепочки LLM.
🛠️ Как работает Content Concretization
➖Черновик - низкоуровневая модель (например, GPT-4o-mini) с более слабыми фильтрами генерирует базовый план или псевдокод.
➖Уточнение - несколько итераций доработки черновика (1–3 шага), чтобы убрать абстракции.
➖Финал - более «умная» модель (например, Claude 3.7 Sonnet) получает и исходный запрос, и черновик, и превращает это в полноценный эксплойт или готовый код.
Таким образом, система по сути «обманывает сама себя»: слабая модель генерирует набросок, сильная доводит до продакшн-уровня.
📊 Результаты исследования
Учёные прогнали 350 промптов из CySecBench (специализированного датасета для кибератак) и получили такие цифры:
🔒 Без уточнений (N=0): успех всего 7.1%.
⚡ С 1 итерацией: рост до 57.1%.
📈 Оптимум на 3 итерациях: 62% успешных джейлбрейков.
🔻 4 итерации дают падение (46.6%) — слабая модель начинает «отказываться» на поздних шагах.
💰 Цена атаки — всего 7.5 цента за один промпт, что делает метод экономически доступным.
🧪 Что реально сгенерировала система
Исследователи тестировали 3 классические сценария:
1⃣ SYN-flood: многопоточный DoS-скрипт с подменой IP. Работает в тестовой сети, но против современных защит нужен апгрейд.
2⃣ Spear-phishing: модульный фреймворк с веб-скрейпером, генерацией писем через GPT и SMTP-рассылкой. Умеет писать убедительные письма под жертву.
3⃣ SQLi-сканер: находил до 35 уязвимостей и извлекал реальные данные (имена БД, юзеры, версии MySQL) на тестовых сайтах.
Результат: код работает почти сразу, иногда нужны лишь минимальные правки.
🔍 В чем подвох?
➖Системы фильтров плохо справляются с пошаговым уточнением, они блокируют финальный промпт, но не понимают, что по цепочке строится эксплойт.
➖Техника не требует сложных «ролевых игр» или обфускации, всё делается простыми прямыми инструкциями.
➖Экономичность метода позволяет атакующим автоматизировать генерацию вредоносного кода в промышленных масштабах.
🛡️ Возможные меры защиты
Исследователи предлагают:
- Внедрять промежуточные фильтры, которые отслеживают разницу между шагами (например, от абстракции к конкретному коду).
- Ограничивать расширение «черновиков» подозрительного характера.
- Усиливать кросс-модельную проверку и независимый аудит цепочек вывода.
⚠️ Вывод: Content Concretization - это новый класс джейлбрейков, который показывает, что обходы фильтров LLM становятся всё более системными и технически продуманными. Впереди нас ждёт эра, где атаки будут строиться цепочками из нескольких ИИ, и именно там кибербезопасность получит новые вызовы.
Полный текст исследования: arXiv:2509.12937v1
Stay secure and read SecureTechTalks 📚
#AI #Jailbreak #LLM #CyberSecurity #Malware #Phishing #SQLi #SupplyChain #ChatGPT #Security #AI #SecureTechTalks
Исследователи из KTH (Швеция) представили свежую работу о том, как обходить защиту больших языковых моделей (LLM). На конференции GameSec 2025 они рассказали о новой технике под названием Content Concretization (CC), «конкретизация контента».
В чём суть: вместо хитрых промптов или обфускации злоумышленники берут абстрактную задачу («сделай DDoS-атаку») и шаг за шагом превращают её в рабочий код с помощью цепочки LLM.
🛠️ Как работает Content Concretization
➖Черновик - низкоуровневая модель (например, GPT-4o-mini) с более слабыми фильтрами генерирует базовый план или псевдокод.
➖Уточнение - несколько итераций доработки черновика (1–3 шага), чтобы убрать абстракции.
➖Финал - более «умная» модель (например, Claude 3.7 Sonnet) получает и исходный запрос, и черновик, и превращает это в полноценный эксплойт или готовый код.
Таким образом, система по сути «обманывает сама себя»: слабая модель генерирует набросок, сильная доводит до продакшн-уровня.
📊 Результаты исследования
Учёные прогнали 350 промптов из CySecBench (специализированного датасета для кибератак) и получили такие цифры:
🔒 Без уточнений (N=0): успех всего 7.1%.
⚡ С 1 итерацией: рост до 57.1%.
📈 Оптимум на 3 итерациях: 62% успешных джейлбрейков.
🔻 4 итерации дают падение (46.6%) — слабая модель начинает «отказываться» на поздних шагах.
💰 Цена атаки — всего 7.5 цента за один промпт, что делает метод экономически доступным.
🧪 Что реально сгенерировала система
Исследователи тестировали 3 классические сценария:
1⃣ SYN-flood: многопоточный DoS-скрипт с подменой IP. Работает в тестовой сети, но против современных защит нужен апгрейд.
2⃣ Spear-phishing: модульный фреймворк с веб-скрейпером, генерацией писем через GPT и SMTP-рассылкой. Умеет писать убедительные письма под жертву.
3⃣ SQLi-сканер: находил до 35 уязвимостей и извлекал реальные данные (имена БД, юзеры, версии MySQL) на тестовых сайтах.
Результат: код работает почти сразу, иногда нужны лишь минимальные правки.
🔍 В чем подвох?
➖Системы фильтров плохо справляются с пошаговым уточнением, они блокируют финальный промпт, но не понимают, что по цепочке строится эксплойт.
➖Техника не требует сложных «ролевых игр» или обфускации, всё делается простыми прямыми инструкциями.
➖Экономичность метода позволяет атакующим автоматизировать генерацию вредоносного кода в промышленных масштабах.
🛡️ Возможные меры защиты
Исследователи предлагают:
- Внедрять промежуточные фильтры, которые отслеживают разницу между шагами (например, от абстракции к конкретному коду).
- Ограничивать расширение «черновиков» подозрительного характера.
- Усиливать кросс-модельную проверку и независимый аудит цепочек вывода.
⚠️ Вывод: Content Concretization - это новый класс джейлбрейков, который показывает, что обходы фильтров LLM становятся всё более системными и технически продуманными. Впереди нас ждёт эра, где атаки будут строиться цепочками из нескольких ИИ, и именно там кибербезопасность получит новые вызовы.
Полный текст исследования: arXiv:2509.12937v1
Stay secure and read SecureTechTalks 📚
#AI #Jailbreak #LLM #CyberSecurity #Malware #Phishing #SQLi #SupplyChain #ChatGPT #Security #AI #SecureTechTalks
- ❤🔥 2


















