У нейронок есть тяжелый акцент. Он не исчезает при переходе с английского на русский, из делового письма — в любовную сцену, из исторической справки — в некролог. Меняются слова, длина предложений и степень пафоса, но за ними остаётся один и тот же тяжелый и узнаваемый паттерн. Тостер сначала объяснит, что собирается сказать, затем скажет это дважды, разложит по пунктам и напоследок напомнит, почему сказанное было важным.
Охотники за слопом ищут отдельные приметы: длинные тире, любовь к слову «важно», конструкции «это не просто X, это Y» и непременным выводом в конце. Всё это есть, но это легко чистится даже ленивым слоператором (спасибо подписчику за новое клевое слово!), и работает как характерный жест или любимое междометие. Все-таки, человека мы узнаём не по одному жесту или присказке, а по тому, как он говорит целиком.
В одном эксперименте людям предложили отличать сгенерированные англоязычные статьи от настоящих журнальных. Участники, редко работавшие с ИИ, справлялись примерно на уровне случайного выбора и при этом сильно переоценивали свою уверенность. Зато пятеро редакторов, регулярно имевших дело с машинными текстами, совместным решением ошиблись лишь в одном случае из трехсот. Они обращали внимание не только на отдельные слова, но и на шаблонную композицию, тон, отсутствие оригинальности и обязательные аккуратные выводы. Читаем исследование человеческого распознавания ИИ текстов.
Самая заметная черта машинного языка — текст постоянно декларирует, что он делает. Человек обычно просто высказывает мысль, ИИ сначала устанавливает дорожный знак с надписью «сейчас будет важная мысль». Отсюда бесконечные «важно понимать», «ключевой момент заключается», «стоит отметить», «необходимо учитывать». В лингвистике это называется метадискурсом: текст не просто говорит о предмете, но ещё и комментирует собственное устройство, ведёт читателя за руку, указывает, где аргумент, где оговорка и где вывод. Сам по себе метадискурс нормален для мясного автора. Ненормальной становится его плотность и повторение. Хороший автор убирает указатель, если что-то и так очевидно. Нейросеть ставит ещё два — чтобы ты точно понял мысль. Например, авторы часто дают 1-2 примера в подтверждение тезиса, а нейронка влепит 5-10.
С этим связаны знаменитые короткие тезисы по два раза. «Это не просто инструмент. Это новый способ взаимодействия с текстом». «Проблема не ограничивается технологией. Она затрагивает само наше понимание творчества». На слух конструкция может и кажется красивой: есть пауза, противопоставление, ударение на второй части, а по факту это пафос на пустом месте и вода. А еще модель любит антитезы и синтаксический параллелизм: не X, а Y; не только X, но и Y; с одной стороны, с другой стороны.
И тут у меня есть забавное наблюдение: автор обычно пишет мысль, а в моменте видит, что ее хорошо иллюстрирует какой-то прием. Модель работает
Многие хорошие авторы (лол, где они) знают литературные правила и приемы. Но ИИ, в отличие даже от опытного человека, следует им фанатично. В машинном тексте абзацы стремятся быть примерно одинакового веса, аргументы — собираться в симметричные группы, а вступление и заключение — зеркально повторять друг друга. Если есть два взгляда, каждому выдадут равную площадь и силу голоса. Если обозначены три причины, в финале послушно вернутся все три. Статья не может просто закончиться на сильной детали, неприятном вопросе или провокационной мысли. Она должна закрыться по правилам: короткое резюме, осторожный оптимизм, взгляд в будущее. Все эти маркеры уже собираются в таксономию.
Почему так? Самый популярный ответ — «нейросеть просто угадывает следующее слово» — технически похож на правду, но почти ничего не объясняет. Это всё равно что описать писателя словами «он сокращает мышцы пальцев в определённой последовательности». Да, в основе языковой модели лежит предсказание следующего фрагмента текста. Но чтобы делать это достаточно хорошо, ей приходится выучить грамматику, жанры, типичные аргументы, отношения между понятиями, устройство диалогов и массу сведений о мире. Поэтому из простого учебного задания возникает довольно сложная система внутренних представлений.
Тем не менее, такой способ генерации всё равно оставляет жирнющий след. Модель создаёт текст последовательно, каждый раз продолжая уже написанное. Она может составить план, имитировать редактуру и даже запустить отдельный цикл проверки, если система или пользователь заставят её это сделать. Но обычная команда «напиши статью» чаще всего вызывает один гладкий проход от начала до конца. У такого текста нет стадии, на которой автор перечитал всё целиком, понял, что третий абзац повторяет первый, выкинул красивую фразу, потому что она уводит не туда, и переписал вступление после того, как сам наконец разобрался, о чём хотел сказать. Локально удачное продолжение выигрывает у глобальной задумки. Фраза подходит к предыдущей фразе — и этого достаточно, чтобы она появилась, даже если всей статье она не нужна.
Мыслей много, сказать хочется много, описать кейсы того, как я использую ИИ в работе — но объемы телеги суровы, продолжение в следующей серии.