Как отличать сгенерированный контент
Чем дальше, тем больше будет сгенерированных статей, картинок, музыки и видео. Если видео и аудио достаточно просто понять когда оно сгенерировано, то вот с текстом всё сложнее. Начнём как раз со сложного)
Текст
Первое, что нужно понимать это то что языковые модели изучали интернет статьи, которые на 80% состоят из "воды". Поэтому и статьи которые генерируют нейросети такие же.
Отсюда следуют все основные признаки как можно визуально отличать генерацию:
(1) Все сгенерированные текста носят формальный тон, больше напоминающий абстрактные инструкции. (2) Это из-за того, что при обучении нейросеть находит общие патерны во фразах, в итоге постоянно использует одинаковые словосочетания и структуру предложения, нет редких слов и разнооборазия в изложении. (3) Также часто повторяет одни и те же выводы, (4) которые разбиты по чрезмерному количеству списков.
(5) Нейросетки могут генерировать только обезличенный текст. (6) Попытка сгенерировать текст, где автор делиться своим опытом приводит к "галлюцинациям" и логическим нестыковкам начиная от повествования и заканчивая законами природы.
(7) И конечно же, чрезмерная "политкоректность", ибо компании пытаются избегать лишних скандалов. (8) Из-за таких ограничений и нейросеток потерян эмоциональный окрас текста и (9) отсутствует субъективность.
Но конечно же, обладай текст всеми признаками выше, это не означает, что он сгенерирован. Какие ещё признаки есть:
1) Моё любимое) Тире:
— нейросетка. Такого нет на клавиатуре, это спец символ который нужно умышленно написать, чем люди не занимаются
- вот такое человек будет писать
2) Частенько в сгенерированных презентациях:
В Заголовках Каждое Новое Слово С Большой Буквы
3) Вроде перестало попадаться, но раньше точно было:
по всему тексту после двоеточия первое слово: С заглавной буквы
4) Грамматические ошибки и опечатки. Нейронки не ошибаются.
Никаких скрытых символов, ни в одной LLM я не находил.
Касательно сервисов которые якобы находят генерацию... Я пробовал несколько разных. Сгенерировал текст, написал сам пару предложений и третий вариант когда отредактировал сгенерированый текст. и всегда ответ один: с вероятностью 40-60% процентов, что текст сгенерирован нейросетью.
Вероятность "50 на 50" на деле, ничего нам не говорит. С такой же вероятностью можно на улице встретить динозавра: либо встретить либо нет)
Сервисы точно также анализируют текст по тем же признакам, что я написал выше, но такой текст вполне может написать и человек.
Выходит, что можно понять только какой текст точно не писала нейросеть)
Конечно же копирайтеры редко когда полностью используют сгенерированный текст. Он видоизменяется и дорабатывает вручную. Так что, в большинстве случаев, все статьи, которые вам встречаются - это химеры, частично человек, частично нейросеть.
Изображение, аудио и видео
С файлами все гораздо проще, так как информации в них в тысячи раз больше:
1) У файла будут отсутсвовать метаданные или там будет указано, что оно сгенерировано где и кем. Проверка EXIF без проблем это покажет.
2) Если же в файл нарочно добавили эти данные, то сами нейросети оставляют скрытую маркировку: например IPTC-метаданные оставляет Google. Подобные метки будут у всех моделей, так как регуляторы будут обязывать это делать.
Если нет возможности проверить файл то:
- В картинках - проблемы с текстом, слишком гладкие текстуры, неестественная пластика объектов.
- В видео - проблемы с текстом, механикой, суставами, физикой.
- В аудио - ошибки в ударениях, "дерганая" скорость произношения слов
Самый главный вопрос:
А как реагирует SEO, ASO, AIO на сгенерированный контент?
Да абсолютно нормально. Большинство сервисов никак не проверяют генерацию, контент есть и всех всё устраивает, лишь бы пользователям нравился.
Но есть сервисы, например Pinterest, которые считают, что очень важно, чтобы люди понимали, где сгенерированные картинки, а где созданные человеком, абсолютно игнорируя тот факт, что в обоих случаях изображение будет создано человеком, просто разным способом.
Всем добра)
#AI #Дизайн #Инструменты
Post #47
80
- 🔥 4