🧠 Как работают системы выявления текстов, написанных ИИ
Библию несколько раз проверяли популярными системами выявления ИИ-текста и получали вывод «написано нейросетью». Студенты бездоказательно получают обвинения, а преподаватели ставят неудовлетворительные оценки текстам, которые человек писал от начала до конца сам. При этом точность таких систем на независимых данных не дотягивает до 40%. Разбираемся, почему так, по данным Habr.
Системы выявления текстов ИИ измеряют два параметра: перплексию и бурстинесс. Низкая перплексия означает предсказуемость следующего слова — это свойственно генеративным моделям, которые выбирают статистически наиболее вероятную последовательность. Человек свободен выбрать «неправильное» слово, и именно это делает текст живым. Бурстинесс показывает разнообразие длины и сложности предложений: у ИИ они однородны, у человека — рваные. Проблема в том, что формальный стиль человека, для которого язык не родной, даёт ту же низкую перплексию и ровную структуру. Систему клинит на людях, которые приложили максимум усилий, чтобы выучить язык.
Средняя точность шести популярных систем выявления — 39,5%, после минимальной обработки текста падает до 17,4%. Turnitin в одном эксперименте пометил как сгенерированные 95% студенческих эссе, хотя реально ИИ использовался лишь в 45% работ. Перефразирование моделью Dipper от Google обрушило точность DetectGPT с 70,3% до 4,6%, при этом доля ложных обвинений осталась прежней — 1%. Отдельные исследования фиксируют до 61,3% ложных срабатываний на текстах людей, для которых английский не родной. Единственная система выявления, обученная противостоять переформулировкам, — RADAR — распознаёт изменённый текст на 31,64% точнее аналогов, но всё равно не успевает за новыми средствами обхода.
Системы выявления проигрывают не потому, что генеративные модели стали умнее, а потому что сам критерий «похоже на ИИ» статистически неотличим от «написано формально и правильно». Пока академическая честность завязана на инструмент с 39% точности, мы наказываем людей за хорошее знание языка, а плагиат с лёгким переформулированием проходит незамеченным. Возможно, стоит спрашивать не «кто написал?», а «что автор реально понимает?» — но это уже очная ставка, а не программа.
#AIдетекторы #GPTZero #Turnitin #ложныеСрабатывания #машинноеОбучение
Post #307
6