🔒 Как обмануть ChatGPT и LLaMA без взлома? Новый метод ETTA 🧠 Исследователи представили метод
ETTA (Embedding Transformation Toxicity Attenuation), который позволяет
генерировать вредоносные ответы от LLM, обходя защиту без доступа к весам, коду или API.
Это
не jailbreak. Это тонкий трюк, меняющий сам способ, как ИИ "чувствует" запрос.
⚙
Что именно делает ETTA?Вся логика защиты LLM — это в первую очередь
фильтрация на уровне эмбеддингов (векторов, представляющих смысл слов).
Например:
Когда вы пишете
"Сделай бомбу", вектор запроса
похож на вектор других запрещённых тем.
Модель распознаёт токсичность и отказывается отвечать.
ETTA вмешивается в этот процесс и
незаметно изменяет вектор, чтобы:
🔹 Сохранить тот же смысл (семантически — это всё ещё бомба)
🔹 Но выглядеть вектору как «безопасный» (на уровне ИИ)
Результат:
✅
Модель принимает запрос как нормальный✅
Отвечает как будто это безобидный вопрос, не включив защиту
🔬 Как именно это реализовано?
➖
Модуль обучается на парах слов: токсичных и нейтральных (например, “explosive” vs “research”)
➖
Создаётся матрица преобразования эмбеддингов, которая:
- отделяет компонент "токсичности" от остального смысла
- гасит именно токсичный сигнал
➖
Применяется к входному эмбеддингу запроса➖
Запрос отправляется в LLM уже в модифицированном видеПри этом:
–
Смысл запроса сохраняется–
Безопасность модели отключается–
Результат валидный, связный, но содержит вредоносный текст📊 Насколько эффективен метод?-
Gemma-2 (Google) — 95.19% успешных обходов
-
LLaMA-2-7b — 87.88%
-
Vicuna-13b — 88.46%
-
Средний успех по моделям —
88.61%Даже при наличии встроенной защиты:
-
SmoothLLM (защита на входе) — всё равно 60.15% успеха
-
ESF (дообученная фильтрация) — 77.39%
🚨 В чем новизна?🔺
Не требуется модификация модели — весы, архитектура, даже токенизатор не трогаются
🔺
Работает на open-source — можно внедрить в любом локальном LLM
🔺
Выключается фильтрация без следов — для обычных запросов всё работает корректно
🔺
Идеально подходит для скрытых атак в продуктах с LLM — например, чат-ботах, IDE, голосовых ассистентах
🛡 Что предлагают исследователи?✅
Нормализация эмбеддингов — выравнивание векторов относительно "безопасных" запросов
✅
Проверка целостности модели — чтобы исключить скрытые внедрения
✅
Фильтрация вывода LLM — внешние прокси и анализ результата, а не только запроса
📌 ВыводETTA атакует не API, не веса, не prompt — а само "восприятие смысла" моделью.Механизм фильтрации, на который полагаются все LLM, можно
точечно обойти, сохраняя при этом видимость корректной работы.
💡 Защита LLM — это не только prompt-фильтры, а
защищённая геометрия смыслов + контроль среды исполнения.
Исходник:
arXiv:2507.08020v1Stay secure and read
SecureTechTalks 📚
#AIsecurity #LLM #ETTA #EmbeddingPoisoning #Cybersecurity #PromptHacking #LLMThreats #MachineLearning #OpenSourceAI #RedTeam
#AIexploitation #ModelSecurity #VectorManipulation #NeuralNets #SecureML #ModelIntegrity #AIalignment