Признаемся честно: нас всегда удивляла тяга к созданию детекторов текстов, написанных LLM. Зачем переживать о том, как именно был написан текст, если в нем нет, например, мысли. А если мысль есть — то какая разница с помощью Word или ChatGPT её оформили?
Так или иначе, с развитием LLM стали появляться сервисы-детекторы (GPTZero, Originality.ai и др.), которые обещают с восхитительной точностью отличить текст человека от «машинного». Но как им можно верить, если нейросети обучались на миллиардах страниц человеческого текста? Разбираемся, как это работает.
Математика «предсказуемости»
Детекторы не «читают» текст, как люди. Они ищут статистические аномалии, используя два главных параметра:
6️⃣ Перплексия: это мера сложности текста. LLM обучены выбирать наиболее вероятное следующее слово. Поэтому их текст получается «гладким» и предсказуемым. Если детектор легко предсказывает следующее слово в предложении, он дает сигнал тревоги.
2️⃣ Вариативность: люди пишут неравномерно: одно длинное сложное предложение, за ним — короткое и резкое. У ИИ структура более монотонная.
Что говорит наука?
Исследования, сделанные еще в 2023 году, показывают, что доверять детекторам на 100% — глупая затея.
Исследование Стэнфордского университета показало шокирующие результаты. Детекторы пометили более 60% эссе, написанных не-носителями английского, как «сгенерированные ИИ». Причина? Ограниченный словарный запас и простые грамматические конструкции, которые детекторы ошибочно принимают за «предсказуемость» нейросети.
Ученые из Университета Мэриленда в своей статье «Can AI-Generated Text be Reliably Detected?» доказали, что по мере совершенствования LLM вероятность ошибки детектора будет стремиться к 50%. То есть результат будет не точнее подбрасывания монетки.
Детекторы часто называют Конституцию США или Библию текстами, написанными нейросетью. Почему? Потому что эти тексты очень логичны, выверены и часто встречаются в обучающих выборках ИИ.
Как на этом наживаются мошенники?
Появление детекторов породило новый вид мошенничества — сервисы «гуманизации» (humanizers). Портал Punch описывает эту схему как замкнутый круг страха:
➡️ Запугивание: студентов или копирайтеров пугают тем, что их тексты не пройдут проверку, даже если они писали их сами.
➡️ Платное «спасение»: мошенники предлагают подписку на «обходчики детекторов». Эти сервисы якобы переписывают текст так, чтобы ИИ его не узнал.
➡️ Результат: в лучшем случае сервис просто вставляет невидимые символы или заменяет буквы на похожие из других алфавитов. В худшем — вы платите за то, что нейросеть просто портит вашу работу, делая её неграмотной.
Это превратилось в настоящую фабрику шантажа. Компании-детекторы продают подписки школам, школы наказывают учеников, а ученики платят «гуманизаторам», чтобы те обманули детекторы.
🖍️ Лучший способ доказать авторство — сохранять историю правок в Google Docs или Word. Это весомее любого «процента вероятности» от сомнительного сервиса.
💬 Тест Тьюринга. События в сфере ИИ. Подписаться
