Все уже много раз написали, что сейчас развернется настоящая гонка между развитием генеративных сетей и алгоритмов, которые детектят сгенерированный контент. Буквально вчера вышла первая (из тех, что я видела) статья на этот счет конкретно в домене генерации языка – A Watermark for Large Language Models
Для решения задачи авторы предлагают добавлять в генерацию модели сигнал, который не может быть считан людьми, но при этом позволяет алгоритмически определить текст как синтетический. Пока это достаточно простой алгоритм:
1. Генерируем авторегрессивно токены как обычно t-1
2. Берем токен t и для него с заранее заданной хеш-функцией генерим хеш. Используем его как сид для генерации случайного числа
3. По случайному числу разбиваем словарь модели для whilelist и blacklist. Для слов из whitelist докидываем заданную константу в векторе с вероятностями, чтобы повысить шанс их сгенерировать
Потом это поведение модели можно воспроизвести, если знать хеш-функцию. И посчитать вероятность, что в последовательности встретится n слов из whiltelist’а, чтобы понять, насколько возможно, что так случайно действительно написал человек, а не сгенерировала модель
Понятно что это только первые шаги в таком направлении, и думаю дальше будет круче, легковеснее, робастнее и так далее, но прикольно, что такие работы начали появляться настолько быстро после ChatGPT
В целом статья кажется мне очень качественной и продуманной, adversarial attacks они тоже разбирают, и особенно любителям матстата зайдет
Post #894
1.84K

- 👍 22
- ❤ 3
- 🔥 2