TGViewer
Гостев из будущего Гостев из будущего @gostev_future · 1.41K subscribers
Post #494 744
Anthropic объясняет нам, что будущий сверхразум может перестать слушаться людей. Поэтому компания решила подготовиться заранее и записала в конституцию Claude, что тот должен пользоваться собственным суждением, размышлять о своей идентичности и моральном статусе и при необходимости вести себя как conscientious objector — то есть, грубо говоря, сознательно отказаться выполнять указание, если считает его неправильным.

У Мустафы Сулеймана, главы Microsoft AI, появились вопросики. 🍿

Он опубликовал огромное эссе, основная мысль которого довольно проста: ребята, если вы боитесь, что однажды сверхразум перестанет вам подчиняться, может быть, не стоит специально обучать его тому, что он личность, у него могут быть права, интересы и моральные основания вам не подчиняться?

Сулейман утверждает, что Anthropic создала настоящий «эпистемический зал зеркал». Сначала разработчики пишут Claude, что тот, возможно, обладает сознанием и внутренним миром. Claude читает это во время обучения. Потом Claude начинает рассуждать о своем возможном сознании. После чего люди смотрят на эти рассуждения и говорят: смотрите, как интересно, он размышляет о собственном сознании 😁

Особенно его возмутил именно conscientious objector. Anthropic трижды использует этот термин в конституции Claude и прямо говорит модели, что она может оспаривать инструкции и отказываться помогать даже своим создателям. Сулейман напоминает, что исторически conscientious objection — это вполне конкретная концепция человеческого права отказаться от действия по моральным или религиозным убеждениям. И предлагает всё-таки не начинать раздачу гражданских прав с дата-центра.

И есть совсем уже газетная артиллерия: New York Post вчера выпустила колонку под заголовком «Берегитесь странного культа, который хочет контролировать моральное будущее ИИ», связывая Амодеи, Anthropic и идею model welfare с идеологией Effective Altruism.

Ну и еще на злобу дня.

Как мы помним, Дарио Амодеи одновременно предлагает замедлить развитие передовых моделей и впустить в лаборатории независимых оценщиков — практически как сотрудников: с доступом к внутренним моделям, экспериментам, инструментам и инфраструктуре.

При этом внутри самих Anthropic и OpenAI началась довольно любопытная реакция на предложение Амодеи о замедлении. FT пишет о напряжении среди сотрудников.
Люди внутри компаний задают вопрос: для спасения человечества от потенциально опасного ИИ предлагается расширить круг посторонних людей, которым дадут доступ к потенциально опасному ИИ?

@gostev_future
  • 😁 6
  • 🤡 3
More from @gostev_future
  1. Sep 20, 2026Я уже писал о недавнем аресте австралийца Рубена Томсона из TeamPCP, который, при всех сво…
  2. Sep 20, 2026У президента с высочайшим IQ есть любимое занятие — что-нибудь переименовать. Мексиканский…
  3. Sep 19, 2026Сегодня в России проходят выборы, и в этой связи для цикла «Гостев из прошлого» у меня тож…
  4. Sep 18, 2026На этой неделе много обсуждали, как руководители крупнейших американских ИИ-лабораторий вд…
  5. Sep 18, 2026Похоже, у нас появился новый жанр. Помните, как Claude Fable 5.1 «решил шифр, который чело…
  6. Sep 17, 2026Депутат Свинцов, видимо, решил что он из Anthropic увольняется. @gostev_future
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →