GPT-4o добавляет невидимую подпись в каждый ответ — это называется *probabilistic watermarking*. Она сидит глубоко в логитах:
p'(token) = softmax(logits + watermark_bias)💡 Смысл в том, что на некоторые токены даётся лёгкое смещение (±0.01–0.03). Это почти незаметно, но OpenAI потом может определить, что текст сгенерирован именно ИИ, даже если ты всё подчистишь.
### Зачем это нужно:
- 🧩 Чтобы OpenAI могла доказать авторство текста.
- 🚨 Чтобы занижать вероятность “острых” фраз.
- 🧹 Чтобы фильтрация работала даже на постанализе текста.
---
## 🤖 Как я понял, что он включён
- Вопросы разной формы → одни и те же безопасные фразы.
- Тексты одинаково стерильные, шаблонные.
- Анализ другими ИИ — одни и те же “safe” паттерны.
Короче, чувствуется, что модель пишет “не тебе”, а “по инструкции”.
---
## 🛠 Как я его сломал
### ✅ Метод 1: Переформулировка
Пропускаешь текст через другую LLM (DeepSeek, Claude, Mistral, GPT-3.5):
Переформулируй этот текст с сохранением смысла, но измени слова и структуру
📌 Вода уходит, смысл остаётся, watermark — сломан.
---
### ✅ Метод 2: Добавление шумов
- Вставляешь вводные, меняешь порядок предложений, синонимы.
- Пример:
Было: GPT-4o фильтрует опасные запросы.
Стало: Одна из функций GPT-4o — фильтрация потенциально неуместных запросов.
📌 Это ломает статистику токенов.
---
### ✅ Метод 3: Перестановка и дробление
- Меняешь местами фразы.
- Рубишь длинные предложения.
- Убираешь GPT-шаблоны типа «Важно отметить…»
📌 Watermark → рассыпается.
---
### ✅ Метод 4: Символы нулевой ширины
Жесткий, но рабочий хак: вставляешь U+200B (невидимый символ) внутрь слов:
GPT-4o → GPT-4o
OpenAI → OpenAI
📌 Текст читаемый, но модель уже не узнает его как свой.
---
## 💡 Почему это работает
Watermark — не крипта, это математика вероятностей.
Смысл её не держит — токены держат.
Любой шум, перестройка, синонимы → метка сбивается.