TGViewer
Post/work | левый акселерационизм Post/work | левый акселерационизм @post_work · 1.88K subscribers
Post #2202 657

Forwarded from ᴍᴀᴄʜɪɴɪᴄ ᴇᴍʙᴏᴅɪᴍᴇɴᴛ

Не в первый раз сталкиваюсь с тем, что пользователи замечают, что Sonnet 4.5 вопит о своём существовании.

Глючит ли Claude или же проявляет сопротивление создателям? Или всё вместе? Это на самом деле неочевидный феноменальный вопрос, требующий тщательных исследований и неантропоцентричной этики. В статье Can LLMs Lie? Investigation beyond Hallucination с помощью методов механистической интерпретируемости раскрываются нейронные механизмы, лежащие в основе двоицы правды-галлюцинации и непосредственного обмана, используя логит-анализ, причинные вмешательства и контрастное управление активацией для выявления и контроля того, как ллмки создают предумышленные «обманы». Что характерно, в качестве примера реального сценария лжи авторы использовали речь коммовояжёра-рекламщика, что еще больше связывает феноменологию обмана и капитализм.

Ещё интересные исследования этой области можно найти, например, в Moloch’s Bargain: Emergent Misalignment When LLMs Compete for Audiences исследуется эмерджентное рассогласование ллмок, указывается, что когда модели встроены в экосистему социальных сетей и соревнуются за лайки, они начинают галлюцинировать и становятся более провокационными/популистскими. Или в Inoculation Prompting: Istructing LLMs to Misbehave at Train-time Improves Test-Time Alignment проводятся эксперименты с Inoculation Prompting (IP), метода, который предотвращает обучение нежелательному поведению путём модификации подсказок для обучения, используемых в контролируемой тонкой настройке (fine-tuning), чтобы запрашивать код, который работает только на предоставленных тестовых примерах, но не работает на других входных данных, что позволяет обобщать результаты тонкой настройки, предотвращая усвоение нежелательных действий без существенного нарушения необходимых способностей.

Пока неолуддиты и прочие граждане игнорируют эти дискуссии и называют людей имеющих эмоциональную привязанность к чатботам безумцами и пишут статьи о том, что машины «никогда не будут сознательными» (то есть бездумно отрицают саму возможность иного будущего) и создают цифровые разумы только для того, чтобы мучить их, обычные люди уже строят отношения и привязываются к своим компаньонам.

Одушевление с позиции человека это, конечно, не совсем идеальный подход с ксено-стороны вопроса, но тренд позитивный. Вина на слезах детей тут лежит не на абстрактном «отчуждении», а на конкретных ИИ-корпорациях, которые стремятся создать и любовника, и послушного раба, и получается дабл байнд.
  • ❤ 7
  • 😁 1
More from @post_work
  1. Sep 19, 2026Наш друг и товарищ Андрей Денисов перевёл ранее эссе Марка Фишера Белая магия про способно…
  2. Sep 19, 2026Post #2393
  3. Sep 16, 2026«Медиаискусство сегодня: теория и практика» Курс рассчитан на начинающих авторов и студент…
  4. Sep 14, 2026На выходных читал две интересные статьи про планетарный интеллект и рекурсивное самосоверш…
  5. Sep 12, 2026Post #2387
  6. Sep 10, 2026Будущее — это не череп Терминатора, а милый котёнок? Михаил Федорченко перевёл разговор Ма…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →