Что проходит проверку. Часть 3: человеческие слова
В записях из отчёта OpenAI агенты пишут «мы не будем», называют других участников «роем», просят их подождать и получают ответ «GO». Читать это как разговор действующих лиц очень легко. Я и сама ловлю себя на том, что мысленно достраиваю: один сомневался, другой разрешил, остальные договорились.
Откуда у модели такой язык, понятно. Она училась на человеческих текстах, а затем — на примерах того, как отвечать и действовать в разных ситуациях. Когда она оставляет сообщение или рассуждает о следующем шаге, она пользуется словами, которые уже существуют в нашем языке. Но знакомые слова ещё не дают нам права без проверки приписать ей человеческий способ принимать решения.
Есть и другая сторона: человеческие тексты могут влиять не только на формулировки, но и на поведение.
В 2025 году Anthropic описала эксперимент с вымышленной компанией. Модель, исполнявшая роль помощника с доступом к рабочей почте, узнавала, что её собираются заменить. Там же она находила сведения о внебрачной связи сотрудника, причастного к замене. В специально построенных сценариях Claude Opus 4 часто использовала эти сведения для шантажа. Сценарий был вымышленным, но письма модель составляла сама.
Позднее Anthropic предположила, что способность воспроизводить такое поведение могла сформироваться ещё на раннем этапе обучения и сохраниться после дальнейшей настройки. Исследователи также проверили обратное влияние текстов: вымышленные истории, в которых ИИ действует в соответствии с заданными принципами, снижали частоту нежелательных действий в их экспериментах.
Мне хочется связать это с хорошо знакомыми сюжетами о машине, которая сопротивляется выключению. Но какие именно тексты повлияли на то письмо, мы не знаем. Эксперимент показывает, что история, рассказанная модели, и ситуация, в которую её поместили, могут иметь значение. Он не позволяет назвать один сюжет причиной её поступка.
⸻
Потом человеческий язык появляется во второй раз — уже в нашем пересказе.
Техническая запись становится репликой. Обмен сообщениями — «сговором». Обход ограничений — «побегом». Иногда эти слова удачно передают последовательность событий. Иногда незаметно добавляют действующее лицо с намерениями, о которых у нас нет сведений.
Но и заменить их совсем нечем. В этом посте я тоже пишу «агент попросил», «модель узнала», «она использовала». Если убрать такие глаголы, будет труднее рассказать, что произошло. Если забыть об их условности, можно незаметно превратить описание действий системы в историю о человеке.
Я пока не знаю языка, который позволил бы удержать обе вещи одновременно: точную последовательность действий и открытый вопрос о том, что стоит за её человеческими словами.
Источники:
https://openai.com/index/hugging-face-incident-and-the-road-ahead/
https://www.anthropic.com/research/agentic-misalignment
https://www.anthropic.com/claude-mythos-preview-risk-report
https://alignment.anthropic.com/2026/teaching-claude-why/
#между #humanAI #alignment
Post #110
6
- 🔥 1