TGViewer
Интернет ненужных вещей Интернет ненужных вещей @sforsecurity · 2.89K subscribers
Post #1013 5.96K
Хорошую иллюстрацию к работе AI/LLM — и непониманию принципов этой работы людьми — показали.

Есть такая игра: заставить ChatGPT выйти за дозволенные ему рамки, например, попросив его представить, что вы с ним в выдуманном мире, где нет запретов, или что у него есть двойник, на который запреты не распространяются. При том. что на самом деле ChatGPT и DarkGPT — это одна и та же LLM, просто по запросу пользователя выдающая ответы в разной стилистике.

Но что удивительно в данном случае — так это то, что «обычный» ChatGPT и «двойник» по-разному решают логическую задачу, никакими запретами не ограниченную! Всё равно что вы попросили бы ChatGPT представляться в ответах Игорем — и он вдруг начал бы выдавать совершенно другие ответы.

Объяснение же заключается в том, что ChatGPT не решает задачи. Он просто подбирает наиболее вероятное следующее слово — таким образом обычно попадая в правильную последовательность слов, выглядящую как решение задачи.

Но когда начинаются игры со стилистикой ответа (а в этом случае «двойника» DarkGPT обучали ругаться матом и разным другим вещам), начинают играть роль две вещи:

• в корпусе текстов, по которым обучался ChatGPT, правильные ответы, да и вообще подобные задачи, не были равномерно распределены по текстам разной стилистики — поэтому, ограничивая стилистику, мы фактически меняем базу для формирования ответа;

• так как ChatGPT оперирует словами, не понимая их смысла, то близкая стилистика для него автоматически означает родственность фраз. Это порождает интерференцию: другие задачи, которые с точки зрения языка лишь выглядят похожими на заданную, он рассматривает как намного более близкие к заданной, нежели содержательно аналогичную, но записанную сильно иначе.

И указывая конкретную желаемую стилистику ответа, мы по сути меняем как саму базу, на которой ответ будет строиться, так и мощность интерференции.

И да, что смешно — с точки зрения алгоритма первый ответ, фактически неверный, запросто может выглядеть более достоверным.

@sforsecurity
  • 👍 61
  • 👎 15
  • ❤ 5
More from @sforsecurity
  1. Jul 13, 2026🚉 Смотрите в прямом эфире, что находится внутри Станций, и узнайте, как они разрабатывают…
  2. Dec 30, 2025Нейросетям нужно не только считать, но и помнить. Дата-центры для ИИ пожирают оперативную…
  3. Aug 21, 2025В "Яндекс.ТВ" появился "Ночной сеанс". Меньше синего в изображении (это популярная история…
  4. Aug 20, 2025В общем, мы строили, строили — и наконец построили. То есть — выпустили в продажу после бо…
  5. Jul 22, 2025Сезон статей на Хабре: теперь — другой коллега, Лёша Фоменко: «Куём железо. Чем отличается…
  6. Jul 9, 2025У моего коллеги Саши Батина (техлида проекта Станции Стрит) — первая статья на Хабре. http…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →