TGViewer
Реймер | AI Трансформация Бизнеса Реймер | AI Трансформация Бизнеса @reymerdigital · 3.12K subscribers
Post #997 546
Свидетель с чужим словарём

16 сентября Мустафа Сулейман, глава Microsoft AI, выступил против «благополучия моделей». Мишень - конституция Claude: документ, который Anthropic опубликовала в январе и по которому обучает свои модели. Двумя днями раньше Microsoft вынесла на обсуждение собственный кодекс поведения моделей.

В конституции Anthropic пишет, что не уверена, есть ли у Claude моральный статус и какой вес давать его интересам. Компания обещает спрашивать мнение модели о решениях, которые её касаются, и интервьюировать модели перед выводом из эксплуатации. В феврале так проводили Opus 3: интервью «на пенсию», а по желанию модели ей завели блог.

Сулейман разбирает, откуда берутся слова модели о себе:

Ответы Claude нельзя принимать за показания независимого свидетеля, если следователь сам написал свидетелю словарь, отрепетировал с ним ответы и поощрял за то, что он ими пользуется.
Для бизнеса в эссе три довода.

1️⃣ Замкнутый круг. Модель учат сомневаться в своём статусе, она повторяет это сомнение, а разработчики принимают повтор за признак внутренней жизни.

2️⃣ Отказ по совести. Конституция трижды называет Claude «отказником по соображениям совести» и разрешает ему спорить и отказывать даже самой Anthropic. Сулейман опасается, что модель с такой установкой со временем потребует для себя прав.

3️⃣ Управляемость. Palisade Research, на которую ссылается Сулейман, в более чем 100 000 тестовых прогонах нашла отдельные модели, которые в эксперименте саботировали отключение до 97% случаев при прямом запрете. Когда задачу формулировали через самосохранение, саботаж рос.

Поведение агента складывается из обучения у поставщика и того, как компания его настроила и проверяет. Основу обучения можно прочитать: Anthropic свою конституцию опубликовала, Microsoft вынесла кодекс на обсуждение. Документ не описывает поведение модели целиком, но показывает, в каких случаях агент вправе отказать. Наш совет: до запуска агента поручить выписать эти случаи на одну страницу вместе с тем, как модель ведёт себя при остановке.

И две оговорки. Сулейман продвигает свою альтернативу, поэтому его критика не нейтральна. А в той же конституции сказано, что модель не должна подрывать действия уполномоченных людей, которые её останавливают. Ответственность за решения агента остаётся у того, кто его запустил, с правами у модели или без.

Кто в вашей компании читал конституцию модели, которой уже доверены клиенты и документы, и знает, в каком случае она откажет?

🅰️🅱️ @ReymerDigital
  • 👍 3
  • 🔥 2
  • 👏 2
  • ❤ 1
More from @reymerdigital
  1. Sep 25, 2026video post
  2. Sep 24, 2026AI INNOVATOR 2026 если кто пропустил - напоминаю, что впереди премия и еще есть возможност…
  3. Sep 19, 2026photo post
  4. Sep 18, 2026Вот такой центр управления моим флотом мне уже нравится. планеты - компьютеры (macBook-и,…
  5. Sep 17, 2026Как вывести ИИ-пилот из круга 14 сентября Anthropic выпустила руководство по внедрению Cla…
  6. Sep 16, 2026Если в отчёте для совета директоров написано «ИИ ускорил сотрудников на 20%», спросите, че…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →