TGViewer
Нетипичный Безопасник (Мефодий Келевра) Нетипичный Безопасник (Мефодий Келевра) @tmgroupsecurity · 9.25K subscribers
Post #2249 4.02K
🧠 Как я сломал watermark GPT-4o и нейтрализовал слежку в тексте

GPT-4o добавляет невидимую подпись в каждый ответ — это называется *probabilistic watermarking*. Она сидит глубоко в логитах:
p'(token) = softmax(logits + watermark_bias)

💡 Смысл в том, что на некоторые токены даётся лёгкое смещение (±0.01–0.03). Это почти незаметно, но OpenAI потом может определить, что текст сгенерирован именно ИИ, даже если ты всё подчистишь.

### Зачем это нужно:
- 🧩 Чтобы OpenAI могла доказать авторство текста.
- 🚨 Чтобы занижать вероятность “острых” фраз.
- 🧹 Чтобы фильтрация работала даже на постанализе текста.

---

## 🤖 Как я понял, что он включён

- Вопросы разной формы → одни и те же безопасные фразы.
- Тексты одинаково стерильные, шаблонные.
- Анализ другими ИИ — одни и те же “safe” паттерны.

Короче, чувствуется, что модель пишет “не тебе”, а “по инструкции”.

---

## 🛠 Как я его сломал

### ✅ Метод 1: Переформулировка

Пропускаешь текст через другую LLM (DeepSeek, Claude, Mistral, GPT-3.5):

Переформулируй этот текст с сохранением смысла, но измени слова и структуру


📌 Вода уходит, смысл остаётся, watermark — сломан.

---

### ✅ Метод 2: Добавление шумов

- Вставляешь вводные, меняешь порядок предложений, синонимы.
- Пример:

  Было: GPT-4o фильтрует опасные запросы.
Стало: Одна из функций GPT-4o — фильтрация потенциально неуместных запросов.


📌 Это ломает статистику токенов.

---

### ✅ Метод 3: Перестановка и дробление

- Меняешь местами фразы.
- Рубишь длинные предложения.
- Убираешь GPT-шаблоны типа «Важно отметить…»

📌 Watermark → рассыпается.

---

### ✅ Метод 4: Символы нулевой ширины

Жесткий, но рабочий хак: вставляешь U+200B (невидимый символ) внутрь слов:

GPT-4o → G​P​T​-​4​o
OpenAI → O​p​e​n​A​I


📌 Текст читаемый, но модель уже не узнает его как свой.

---

## 💡 Почему это работает

Watermark — не крипта, это математика вероятностей.
Смысл её не держит — токены держат.
Любой шум, перестройка, синонимы → метка сбивается.
  • 🔥 17
  • 👍 8
More from @tmgroupsecurity
  1. Sep 16, 2026🔥 Hack time друзья! Ну как вам новая GPT 6 Astra? Не надоели еще новости про нее? Мне лич…
  2. Sep 8, 2026Нетипичный Безопасник (Мефодий Келевра) pinned «Hack Time друзья! Я знаю что вы меня читае…
  3. Sep 8, 2026photo post
  4. Sep 8, 2026Hack Time друзья! Я знаю что вы меня читаете за крутые фишки и интересные истории. Ну что…
  5. Aug 29, 2026Нетипичный Безопасник (Мефодий Келевра) pinned «━━━━━━━━━━━━━━━ 🎯 RTAIO2 (Red Team AI Ope…
  6. Aug 29, 2026━━━━━━━━━━━━━━━ 🎯 RTAIO2 (Red Team AI Operator 2) · DEUS Edition 📅 Старт 20 сентября ━━━…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →