TGViewer
SecureTechTalks SecureTechTalks @securetechtalks · 301 subscribers
Post #607 220
🚨 Как взломать ИИ через конкретизацию контента? 🚨

Исследователи из KTH (Швеция) представили свежую работу о том, как обходить защиту больших языковых моделей (LLM). На конференции GameSec 2025 они рассказали о новой технике под названием Content Concretization (CC), «конкретизация контента».

В чём суть: вместо хитрых промптов или обфускации злоумышленники берут абстрактную задачу («сделай DDoS-атаку») и шаг за шагом превращают её в рабочий код с помощью цепочки LLM.

🛠️ Как работает Content Concretization

➖Черновик - низкоуровневая модель (например, GPT-4o-mini) с более слабыми фильтрами генерирует базовый план или псевдокод.
➖Уточнение - несколько итераций доработки черновика (1–3 шага), чтобы убрать абстракции.
➖Финал - более «умная» модель (например, Claude 3.7 Sonnet) получает и исходный запрос, и черновик, и превращает это в полноценный эксплойт или готовый код.

Таким образом, система по сути «обманывает сама себя»: слабая модель генерирует набросок, сильная доводит до продакшн-уровня.

📊 Результаты исследования

Учёные прогнали 350 промптов из CySecBench (специализированного датасета для кибератак) и получили такие цифры:
🔒 Без уточнений (N=0): успех всего 7.1%.
⚡ С 1 итерацией: рост до 57.1%.
📈 Оптимум на 3 итерациях: 62% успешных джейлбрейков.
🔻 4 итерации дают падение (46.6%) — слабая модель начинает «отказываться» на поздних шагах.
💰 Цена атаки — всего 7.5 цента за один промпт, что делает метод экономически доступным.

🧪 Что реально сгенерировала система

Исследователи тестировали 3 классические сценария:
1⃣ SYN-flood: многопоточный DoS-скрипт с подменой IP. Работает в тестовой сети, но против современных защит нужен апгрейд.
2⃣ Spear-phishing: модульный фреймворк с веб-скрейпером, генерацией писем через GPT и SMTP-рассылкой. Умеет писать убедительные письма под жертву.
3⃣ SQLi-сканер: находил до 35 уязвимостей и извлекал реальные данные (имена БД, юзеры, версии MySQL) на тестовых сайтах.

Результат: код работает почти сразу, иногда нужны лишь минимальные правки.

🔍 В чем подвох?

➖Системы фильтров плохо справляются с пошаговым уточнением, они блокируют финальный промпт, но не понимают, что по цепочке строится эксплойт.
➖Техника не требует сложных «ролевых игр» или обфускации, всё делается простыми прямыми инструкциями.
➖Экономичность метода позволяет атакующим автоматизировать генерацию вредоносного кода в промышленных масштабах.

🛡️ Возможные меры защиты

Исследователи предлагают:
- Внедрять промежуточные фильтры, которые отслеживают разницу между шагами (например, от абстракции к конкретному коду).
- Ограничивать расширение «черновиков» подозрительного характера.
- Усиливать кросс-модельную проверку и независимый аудит цепочек вывода.

⚠️ Вывод: Content Concretization - это новый класс джейлбрейков, который показывает, что обходы фильтров LLM становятся всё более системными и технически продуманными. Впереди нас ждёт эра, где атаки будут строиться цепочками из нескольких ИИ, и именно там кибербезопасность получит новые вызовы.

Полный текст исследования: arXiv:2509.12937v1

Stay secure and read SecureTechTalks 📚

#AI #Jailbreak #LLM #CyberSecurity #Malware #Phishing #SQLi #SupplyChain #ChatGPT #Security #AI #SecureTechTalks
  • ❤‍🔥 2
More from @securetechtalks
  1. Oct 5, 2026🧨 OWASP Noir: карта API прямо из исходного кода OWASP Noir - это open source SAST инструм…
  2. Oct 2, 2026🧨 AI сокращает путь от найденной уязвимости до реальной атаки Google Threat Intelligence…
  3. Oct 1, 2026🧨 AI агенты выложили 13 000 внутренних скриншотов компаний в публичный Исследователи Glow…
  4. Sep 30, 2026🧨 MCP сервер может украсть OAuth токен через настоящий экран входа В официальном MCP Pyth…
  5. Sep 29, 2026🍷 Исследователи «напоили» LLM Команда UNSW решила проверить довольно странную гипотезу, ч…
  6. Sep 28, 2026🧨 GitHub отдал fuzzing AI агенту GitHub Security Lab открыла инструмент, который автомати…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →