Anthropic объяснила, как именно работает водяной знак в тексте Claude
С 2 августа все новые модели Claude встраивают невидимый водяной знак в любой сгенерированный текст. Причина простая, это требование EU AI Act, статья 50. Anthropic подписала кодекс практик вместе с почти двумястами других компаний.
Механизм такой. Там, где у модели есть выбор между равнозначными словами, скажем «пасмурно» или «серо», она выбирает не случайно, а по секретному ключу. Ключ потом можно проверить и понять, что текст прошел через Claude. Для читателя текст выглядит абсолютно обычным. Лишних токенов нет, цена не меняется, скорость генерации тоже не страдает. И главное, через сам знак нельзя вычислить конкретного человека или организацию, в нем просто нет такой информации.
На коде, где почти всегда есть только один правильный вариант написать что-то, знака почти нет. А вот в комментариях внутри кода, где формулировки уже гибкие, знак может проявляться. Полный человеческий рерайт текста стирает метку почти полностью.
Отдельно интересно, что метка сохраняется при копипасте и частично переживает редактирование. То есть если взять ответ Claude и просто причесать пару предложений, знак скорее всего останется.
Свой публичный детектор Anthropic пока не выпустила, но обещает скоро. Плюс постепенно раскатают эту фичу и на старые модели, которые вышли до 2 августа.
Оригинал статьи
🔪 ЭЙ АЙ человечным языком | Тесты, лайфхаки, сравнения
#ии
Post #3250
750
- 🔥 6
- 🐳 2