Anthropic пояснила, як саме працює watermark у текстах Claude.
І ні, це не приховані символи, невидимі пробіли чи метадані, які можна просто прибрати з тексту.
Мітка фактично захована у самому способі генерації тексту.
Claude, як і інші мовні моделі, не пише відповідь одразу цілком.
Він генерує її токен за токеном і на кожному кроці обирає наступний варіант із кількох можливих.
Умовно в одному реченні однаково нормально можуть підійти:
швидкий
стрімкий
оперативний
Без watermark модель просто вибирає між відповідними варіантами відповідно до їхньої ймовірності.
А з watermark цей вибір додатково підпорядковується спеціальному алгоритму та секретному ключу.
Тобто Anthropic не вставляє мітку в готовий текст. Вона трохи змінює те, як цей текст збирається.
І ось це вже цікаво.
Один такий вибір побачити неможливо.
Але коли їх сотні, у тексті накопичується статистичний патерн, який можна перевірити спеціальним детектором.
Anthropic використовує для цього технологію SynthID-Text від Google DeepMind.
Тобто мітка — це, по суті, сам текст, просто згенерований певним чином.
Через це звичайний copy-paste її не прибирає.
Невеликий рерайт теж може залишити достатньо сигналу для перевірки.
А от якщо текст сильно переписати, перекласти, перефразувати або змішати з іншим — watermark уже може зникнути.
Є й інші обмеження.
На коротких текстах технологія працює гірше — просто недостатньо токенів, щоб накопичився статистичний сигнал.
З кодом та фактологічними відповідями теж складніше.
Якщо правильний варіант фактично один, модель не може вибрати інший тільки заради watermark.
Умовно:
2 + 2 =Тут особливо не розженешся :)
Ще важливий момент.
Це не універсальний детектор AI-тексту.
Anthropic зможе визначати ймовірність того, що текст створював або суттєво редагував саме Claude.
Якщо його написав ChatGPT, Gemini або інша модель, watermark Claude там, звісно, не буде.
І навіть наявність мітки не означає:
«цей текст на 100% написаний Claude».
Людина могла написати його сама, а потім попросити Claude відредагувати.
Нові моделі Claude, випущені з 2 серпня 2026 року, уже отримують таке маркування.
Для старих моделей Anthropic поступово додає підтримку. До 2 грудня для систем, які були на ринку раніше, діє перехідний період у межах вимог EU AI Act.
Anthropic також готує окремий watermark detection API, через який можна буде перевіряти тексти.
І тут уже видно більший тренд.
Довгий час «детектори AI» намагалися вгадувати авторство за стилем:
довгі тире,
однакові конструкції,
«не просто X, а Y»,
надто гладкий текст.
Тепер підхід змінюється.
AI-компанії самі починають залишати технічний слід у контенті, який генерують їхні моделі.
І якщо OpenAI, Google, Anthropic та інші великі провайдери підуть цим шляхом, визначення AI-контенту поступово може перейти від:
«схоже, це написав ChatGPT»
до:
«у тексті є технічний сигнал конкретної моделі».
Як на мене, це вже набагато цікавіше за черговий сервіс, який визначає AI за кількістю тире в тексті :)
#Claude #Anthropic #AI #watermark #SynthID #AIAct #aicontent #generativeAI