Олег Артамонов. Техлид умных ТВ в Яндексе, сопредседатель Координационного совета при ОП РФ по общественному контролю за голосованием, председатель ТИК ДЭГ 2024 и просто неприятный человек.
Рекламы здесь нет и не надо.
Для связи: @olartamonov
Post #1013
5.96K

Хорошую иллюстрацию к работе AI/LLM — и непониманию принципов этой работы людьми — показали.
Есть такая игра: заставить ChatGPT выйти за дозволенные ему рамки, например, попросив его представить, что вы с ним в выдуманном мире, где нет запретов, или что у него есть двойник, на который запреты не распространяются. При том. что на самом деле ChatGPT и DarkGPT — это одна и та же LLM, просто по запросу пользователя выдающая ответы в разной стилистике.
Но что удивительно в данном случае — так это то, что «обычный» ChatGPT и «двойник» по-разному решают логическую задачу, никакими запретами не ограниченную! Всё равно что вы попросили бы ChatGPT представляться в ответах Игорем — и он вдруг начал бы выдавать совершенно другие ответы.
Объяснение же заключается в том, что ChatGPT не решает задачи. Он просто подбирает наиболее вероятное следующее слово — таким образом обычно попадая в правильную последовательность слов, выглядящую как решение задачи.
Но когда начинаются игры со стилистикой ответа (а в этом случае «двойника» DarkGPT обучали ругаться матом и разным другим вещам), начинают играть роль две вещи:
• в корпусе текстов, по которым обучался ChatGPT, правильные ответы, да и вообще подобные задачи, не были равномерно распределены по текстам разной стилистики — поэтому, ограничивая стилистику, мы фактически меняем базу для формирования ответа;
• так как ChatGPT оперирует словами, не понимая их смысла, то близкая стилистика для него автоматически означает родственность фраз. Это порождает интерференцию: другие задачи, которые с точки зрения языка лишь выглядят похожими на заданную, он рассматривает как намного более близкие к заданной, нежели содержательно аналогичную, но записанную сильно иначе.
И указывая конкретную желаемую стилистику ответа, мы по сути меняем как саму базу, на которой ответ будет строиться, так и мощность интерференции.
И да, что смешно — с точки зрения алгоритма первый ответ, фактически неверный, запросто может выглядеть более достоверным.
@sforsecurity
Есть такая игра: заставить ChatGPT выйти за дозволенные ему рамки, например, попросив его представить, что вы с ним в выдуманном мире, где нет запретов, или что у него есть двойник, на который запреты не распространяются. При том. что на самом деле ChatGPT и DarkGPT — это одна и та же LLM, просто по запросу пользователя выдающая ответы в разной стилистике.
Но что удивительно в данном случае — так это то, что «обычный» ChatGPT и «двойник» по-разному решают логическую задачу, никакими запретами не ограниченную! Всё равно что вы попросили бы ChatGPT представляться в ответах Игорем — и он вдруг начал бы выдавать совершенно другие ответы.
Объяснение же заключается в том, что ChatGPT не решает задачи. Он просто подбирает наиболее вероятное следующее слово — таким образом обычно попадая в правильную последовательность слов, выглядящую как решение задачи.
Но когда начинаются игры со стилистикой ответа (а в этом случае «двойника» DarkGPT обучали ругаться матом и разным другим вещам), начинают играть роль две вещи:
• в корпусе текстов, по которым обучался ChatGPT, правильные ответы, да и вообще подобные задачи, не были равномерно распределены по текстам разной стилистики — поэтому, ограничивая стилистику, мы фактически меняем базу для формирования ответа;
• так как ChatGPT оперирует словами, не понимая их смысла, то близкая стилистика для него автоматически означает родственность фраз. Это порождает интерференцию: другие задачи, которые с точки зрения языка лишь выглядят похожими на заданную, он рассматривает как намного более близкие к заданной, нежели содержательно аналогичную, но записанную сильно иначе.
И указывая конкретную желаемую стилистику ответа, мы по сути меняем как саму базу, на которой ответ будет строиться, так и мощность интерференции.
И да, что смешно — с точки зрения алгоритма первый ответ, фактически неверный, запросто может выглядеть более достоверным.
@sforsecurity
- 👍 61
- 👎 15
- ❤ 5










