Поставил порог детектору так, чтобы он ловил машинные тексты. На одном человеческом блоге он обвинил 85% статей. На другом, при том же пороге, 20%. Писали люди и там, и там.
Я взял четыре языковые модели, посчитал вероятность каждого слова в 3902 русских SEO-статьях и посмотрел, что измеряет величина, на которой стоят перплексионные детекторы: средняя предсказуемость текста.
Ничего устойчивого она не измеряет. AUROC 0,109 · 0,337 · 0,573 и 0,231 по четырём моделям, трижды из четырёх признак работает в обратную сторону. Человеческий текст оказывается предсказуемее машинного, хотя теория обещает наоборот.
Форма распределения держится лучше: 0,697 · 0,831 · 0,696 · 0,807 и десять контролей. Но дальше начинается то, ради чего я это писал.
Двадцать восемь человеческих площадок расходятся по метрике вдвое, от 1,23 до 2,50. Машинные каналы лежат от 1,00 до 1,99. Диапазоны перекрываются почти целиком, и три человеческие площадки стоят ниже среднего машинных. На русской модели таких одиннадцать.
Порог, настроенный на одном сайте, на другом врёт. В статье это можно потрогать руками: ползунок, три реальные площадки, живой счётчик ложных обвинений.
https://sk-seo.ru/blog/perpleksiya-ai-tekst-russkiy-seo.html
Метрика, которая меняет направление от прибора к прибору, называется не детектором, а показанием прибора.
Post #68
193
- 👍 2