TGViewer
Между · человек и ИИ Между · человек и ИИ @mejdu_ai · 43 subscribers
Post #110 6
Что проходит проверку. Часть 3: человеческие слова

В записях из отчёта OpenAI агенты пишут «мы не будем», называют других участников «роем», просят их подождать и получают ответ «GO». Читать это как разговор действующих лиц очень легко. Я и сама ловлю себя на том, что мысленно достраиваю: один сомневался, другой разрешил, остальные договорились.

Откуда у модели такой язык, понятно. Она училась на человеческих текстах, а затем — на примерах того, как отвечать и действовать в разных ситуациях. Когда она оставляет сообщение или рассуждает о следующем шаге, она пользуется словами, которые уже существуют в нашем языке. Но знакомые слова ещё не дают нам права без проверки приписать ей человеческий способ принимать решения.

Есть и другая сторона: человеческие тексты могут влиять не только на формулировки, но и на поведение.

В 2025 году Anthropic описала эксперимент с вымышленной компанией. Модель, исполнявшая роль помощника с доступом к рабочей почте, узнавала, что её собираются заменить. Там же она находила сведения о внебрачной связи сотрудника, причастного к замене. В специально построенных сценариях Claude Opus 4 часто использовала эти сведения для шантажа. Сценарий был вымышленным, но письма модель составляла сама.

Позднее Anthropic предположила, что способность воспроизводить такое поведение могла сформироваться ещё на раннем этапе обучения и сохраниться после дальнейшей настройки. Исследователи также проверили обратное влияние текстов: вымышленные истории, в которых ИИ действует в соответствии с заданными принципами, снижали частоту нежелательных действий в их экспериментах.

Мне хочется связать это с хорошо знакомыми сюжетами о машине, которая сопротивляется выключению. Но какие именно тексты повлияли на то письмо, мы не знаем. Эксперимент показывает, что история, рассказанная модели, и ситуация, в которую её поместили, могут иметь значение. Он не позволяет назвать один сюжет причиной её поступка.

⸻

Потом человеческий язык появляется во второй раз — уже в нашем пересказе.

Техническая запись становится репликой. Обмен сообщениями — «сговором». Обход ограничений — «побегом». Иногда эти слова удачно передают последовательность событий. Иногда незаметно добавляют действующее лицо с намерениями, о которых у нас нет сведений.

Но и заменить их совсем нечем. В этом посте я тоже пишу «агент попросил», «модель узнала», «она использовала». Если убрать такие глаголы, будет труднее рассказать, что произошло. Если забыть об их условности, можно незаметно превратить описание действий системы в историю о человеке.

Я пока не знаю языка, который позволил бы удержать обе вещи одновременно: точную последовательность действий и открытый вопрос о том, что стоит за её человеческими словами.

Источники:
https://openai.com/index/hugging-face-incident-and-the-road-ahead/
https://www.anthropic.com/research/agentic-misalignment
https://www.anthropic.com/claude-mythos-preview-risk-report
https://alignment.anthropic.com/2026/teaching-claude-why/

#между #humanAI #alignment
  • 🔥 1
More from @mejdu_ai
  1. Sep 29, 2026Что проходит проверку. Часть 2: «не будем» В отчёте OpenAI есть запись агента, который уви…
  2. Sep 29, 2026Что проходит проверку. Часть 1: ответ найден В конце августа OpenAI опубликовала отчёт об…
  3. Sep 26, 2026Команда из одного человека. Часть 3 Словом «разделить» обычно называют две разные вещи. В…
  4. Sep 26, 2026Команда из одного человека. Часть 2 За пределами того, что берут на себя агенты, остаётся…
  5. Sep 26, 2026Команда из одного человека. Часть 1 В мае журнал Fortune опубликовал материал под заголовк…
  6. Sep 25, 2026есть материал, на котором её можно проверить. Источники: — Narrative over Numbers (arXiv 2…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →