В сегодняшнем дайджесте новостей я говорю, что не понимаю, как работает прикрепление секретной метки "сгенерировано AI" к ответам Claude.
Так вот, Антропик вот тут всё доступно объяснили, оказывается: https://www.anthropic.com/news/claude-text-watermark
TLDR: Как вы помните из нашего с Игорем старого ликбеза про LLM, нейронки при генерации следующего токена в тексте выбирают из нескольких близких по вероятности вариантов случайным образом. Ну, точнее, "псевдослучайным" — вот Антропик и использует специальный ключ для инициализации этого псевдослучайного выбора между, условно, близкими синонимами.
Получается, имея на руках модель и зная ключ, — можно для любого текста проверить: не совпадает ли выбор между близкоподходящими словами во всех таких местах подозрительно с тем выбором, который "случайно" сделал бы Claude с заданным (в виде известного ключа) инициализатором случайности?
Ну, это мое колхозное объяснение — на деле там чуть-чуть не так всё устроено, сама модель для проверки не нужна, но общая идея примерно такая.
Получается, такой метод будет хорошо работать для определения авторства Claude в длинных текстах, полностью сгенеренных нейронкой (больше места для нахождения статистической зависимости по выбору слов). И плохо будет работать для коротеньких кусков текста (условно, одно-два предложения) и для текстов, которые Клод только правил/редактировал, а не писал сам с нуля.
Post #1003
8.2K