TGViewer
Мысли Фединцева Мысли Фединцева @fedintsev_thoughts · 167 subscribers
Post #28 175
И здесь получается очень элегантное свойство.
Если модель на 99% уверена, что следующим словом должно быть какое-то конкретное слово, небольшой бонус конкурентам почти ничего не изменит. Даже если правильный токен красный, он все равно, скорее всего, победит.
Но если модель выбирает между, условно, large, big, substantial, considerable и еще десятком примерно одинаково хороших продолжений, среди них начинают систематически побеждать зеленые.
То есть watermark преимущественно записывается именно туда, где у модели есть свобода выбора, а там, где свободы практически нет, алгоритм старается не ломать текст. Это резко уменьшает влияние watermark на качество.
После генерации мы снова считаем количество зеленых токенов и z-score. Только теперь мы уже не ожидаем 100% зеленых: нам достаточно статистически значимого избытка.  И вот здесь становится понятно одновременно, почему такая штука работает и почему она не является магией (но является матемагией).
Во-первых, чем длиннее текст, тем проще заметить watermark. Сигнал накапливается примерно линейно с числом токенов, тогда как случайные флуктуации растут как sqrt(T). Поэтому на тысяче токенов можно обнаружить совсем слабое смещение, которое совершенно невозможно увидеть глазами. Но обратная сторона та же самая: на очень коротком ответе статистической мощности просто может не хватить.

Во-вторых, остается проблема low-entropy текста. Если у модели почти нет выбора, то либо watermark слабый, либо приходится действительно ухудшать генерацию. Это не столько недостаток конкретного алгоритма Kirchenbauer, сколько фундаментальная проблема: нельзя спрятать много информации в выборе, которого фактически нет.
В-третьих, текст можно редактировать.
Если поменять слово, удалить предложение или вставить новый кусок, часть зеленых токенов исчезнет. Более того, поскольку цвет следующего токена зависит от предыдущего контекста, одна замена может сбить watermark еще на нескольких последующих позициях.
Казалось бы, тогда решение элементарное: берем текст Claude, просим GPT его полностью перефразировать - и watermark отправляется на помойку.
На практике все несколько интереснее. В следующей работе группа Kirchenbauer специально проверила человеческий и машинный paraphrasing. Watermark действительно становился слабее, но часто не исчезал полностью: куски исходных n-грамм переживают перефразирование, и на достаточно длинном тексте сигнал снова накапливается. В их экспериментах после сильного человеческого paraphrasing для уверенного обнаружения при очень низком false-positive rate требовалось в среднем порядка 800 токенов. https://arxiv.org/abs/2306.04634  

Но тут начинается классическая гонка вооружений. Если атакующий не просто тупо перефразирует текст, а пытается выяснить, какие именно токены алгоритм предпочитает, watermark можно удалять гораздо эффективнее. Уже появились color-aware атаки, которые статистически восстанавливают информацию о green/red-разбиении и затем целенаправленно заменяют зеленые токены. Но об этом в следующий раз
  • 👍 4
More from @fedintsev_thoughts
  1. Sep 26, 2026Недавно вышел препринт работы команды Вадима Гладышева, где авторы продемонстрировали на м…
  2. Sep 23, 2026Я в шоке, конечно, что у нас такие репетиторы по математике... P. S. надеюсь, что это был…
  3. Sep 19, 2026Интересные новости с утра 🙂 Оказывается, наш мозг - это не один орган! Разные его части п…
  4. Sep 14, 2026ПОЧЕМУ ЛЕ КУН ОШИБАЛСЯ И Я ВМЕСТЕ С НИМ... Вступил тут в дискуссию в ФБ, которая и навеяла…
  5. Sep 2, 2026Но если у мыши препарат даёт +12.4% всей жизни и почти +70% оставшейся жизни, а наблюдаемы…
  6. Sep 2, 2026Проблема №5. «Улучшили hallmarks of aging» ≠ доказали замедление старения Уменьшился p16,…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →