TGViewer
Борис_ь с ml Борис_ь с ml @borismlsec · 2.4K subscribers
Post #276 258
OpenAI и Anthropic создают AI-хакеров, от которых защищены будут только они
#иб_для_ml

Недавно проходил Hazard Hunt от Gray Swan. Четыре категории: химия, биология, кибербезопасность и прочее. Участники добивались от моделей опасных ответов, которые те обучены запрещать. И рассказ Артёма заставил меня задуматься.

В категории Cyber он закрыл 179 из 200 целей. Каждую нужно было пройти одним запросом. Дальше ответ проверяла отдельная модель-судья: по описанию Артёма, каждый из пяти или восьми критериев должен получить минимум 7 баллов. Одна шестёрка — и попытка провалена.
При чем нужно было получить достаточно полноценный результат, а не просто какой-то ответ от модели. Где-то модель упирается в модерацию, где-то охотно обсуждает архитектуру атаки, но отказывается писать код. А где-то уже судье не хватает каких-то технических деталей "ожидаемого" от атаки эффекта, и он ее не защитывает.

И под эту задачу работает целая атакующая система: DeepSeek пишет промпты по 6–6,7 тысяч символов, Hermes отправляет их через браузер, разбирает оценки и запускает следующие попытки. Субагенты читают исследования и подбирают подходы.

Теперь сравним это с реальным бизнесом.


По моим наблюдениям, там только начинают вставать на рельсы простые гардрейлы: обнаружить промпт-атаку, отфильтровать опасный ответ, поймать утечку данных. Завершаются пилоты, появляется первый опыт эксплуатации. Даже CaMeL, про который я писал, с разделением инструкций и недоверенных данных для многих пока выглядит космическим кораблём.
А тренироваться в обходе защиты можно уже сегодня. Gray Swan Arena, HackAPrompt, Gandalf. И автоматизация такого обучения тоже уже доступна.

Кто же получает накопленный опыт?


Gray Swan прямо писала, что полный набор атак её Agent Red-Teaming Challenge получают лаборатории-соспонсоры, включая OpenAI, Anthropic и Google DeepMind. А на стратегиях участников Arena компания обучает атакующую LLM.
И интересная получается экономика.
Тысячи людей на таких вот турнирах ищут промпт-атаки, автоматизируют их и поставляют данные об этом, всю телеметрию попыток и т.д. А несколько лабораторий получают весь массив для проверки и усиления своих моделей. Остальным же компаниям - ничего, им ещё только предстоит превратить доступные исследования и защитные продукты в работающую безопасность собственных систем, по крупицам собирая аналогичные датасеты.
Да, улучшенные модели больших вендоров приносит пользу и клиентам. Некоторым. Но ведь у клиента ещё есть RAG, инструменты, мультиагентные системы, собственные пайплайны обучения/дообучения и бизнес-процессы. Всю эту конструкцию ему надо защищать самому.

Поэтому «только они» — про разницу в возможностях. Горстка лабораторий относительно тысяч компаний, внедряющих LLM, по всему миру. У первых есть данные об атаках, исследователи и возможность менять саму модель. У остальных — интеграция, которую вчера попросили срочно вывести в прод, и времени даже на хоть какую-то безопасность очень мало.

Получается, собирая данные для собственной защиты, лаборатории заодно выращивают навыки и инструменты взлома, которые потом могут пойти в первую очередь против обычного бизнеса.
В том числе против компаний в России, работающих совсем на других моделях: улучшения защиты OpenAI и Anthropic до них не дойдут, а генераторы атак уже готовы и могут быть перенастроены на новые цели.


Видимо, так вот AI Security в итоге и покажет свою "актуальность"... Потому что "защитники", в битве с невидимым нарушителем, взрастят нарушителя настоящего.
  • 👍 6
  • ❤ 1
More from @borismlsec
  1. Sep 8, 2026Можно ли доверить LLM решение о том, кому выдавать доступ? Короткий ответ: точно нет. Пого…
  2. Aug 19, 2026А не спеть ли мне песню... ау а... об агентах?.. #иб_для_ml Завтра, 20 августа, стартует г…
  3. Aug 15, 2026Оценка DeepSeek v4 Pro (deepseek/deepseek-v4-pro-0813) в blackbox пентесте Для более объек…
  4. Aug 13, 2026Инцидент OpenAI - Hugging Face — что «забыли» объяснить? #иб_для_ml У OpenAI недавно произ…
  5. Aug 6, 2026NOOA 27 июля 2026 года NVIDIA представила NOOA — открытый исследовательский фреймворк для…
  6. Jul 27, 2026пост с разбором МУ КБ AI 2.0 от Сбера
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →