ОбИИтаемый остров
От осинки не родятся апельсинки. В государствах с несвободной прессой не появляется и независимый ИИ. Вместо щепетильного эксперта люди получают модель, которая уже научилась говорить с оглядкой на власть — Nature.
Исследователи сравнили ответы моделей на политические вопросы на разных языках в 37 странах. Выяснилось, что чем ниже свобода прессы в государстве, тем лояльнее модель отвечает о власти на языке этой страны.
Причем даже не нужно специально «дрессировать» модель. Достаточно забить интернет публикациями своих медиа. Потом приходят краулеры — цифровые кашалоты, которые заглатывают тексты со всего интернета, — и эти материалы попадают в обучающие корпуса. Если их много, модель начинает складывать «правильную» картину мира.
В странах, где есть единая «политика партии и правительства», провластные нарративы уже глубоко сидят в данных. Например, в крупном корпусе CulturaX исследователи нашли 3,1 млн документов из китайских государственных медиа. Это в 41 раз больше, чем доля всей китайской Википедии в том же корпусе.
Сильнее всего перекос виден в текстах про лидеров и госинституты. Там почти каждый четвертый фрагмент пересекался с госмедиа. В результате модель воспроизводила не только систему взглядов, но и сам язык пропаганды, иногда повторяя формулировки почти дословно.
ИИ оказался очень чувствителен к звукам этой «волшебной дудочки». Достаточно было 6400 публикаций госмедиа, чтобы дообученная Llama-2-13b почти в 80% сравнений отвечала более провластно, чем исходная модель.
В этом и есть ответ, почему один и тот же политический вопрос на разных языках может звучать по-разному. Там, где включены «башни-излучатели», ответы смещаются по тону и смыслу. Потому что вместе с языком в модель попадают не только слова, но и готовые оценки, привычные формулировки и система ценностей.
А дальше, как в песне: думайте сами, решайте сами, какую нейронку иметь или не иметь.
#deep_scan
Post #157
471
