Anthropic объясняет нам, что будущий сверхразум может перестать слушаться людей. Поэтому компания решила подготовиться заранее и записала в конституцию Claude, что тот должен пользоваться собственным суждением, размышлять о своей идентичности и моральном статусе и при необходимости вести себя как conscientious objector — то есть, грубо говоря, сознательно отказаться выполнять указание, если считает его неправильным.
У Мустафы Сулеймана, главы Microsoft AI, появились вопросики. 🍿
Он опубликовал огромное эссе, основная мысль которого довольно проста: ребята, если вы боитесь, что однажды сверхразум перестанет вам подчиняться, может быть, не стоит специально обучать его тому, что он личность, у него могут быть права, интересы и моральные основания вам не подчиняться?
Сулейман утверждает, что Anthropic создала настоящий «эпистемический зал зеркал». Сначала разработчики пишут Claude, что тот, возможно, обладает сознанием и внутренним миром. Claude читает это во время обучения. Потом Claude начинает рассуждать о своем возможном сознании. После чего люди смотрят на эти рассуждения и говорят: смотрите, как интересно, он размышляет о собственном сознании 😁
Особенно его возмутил именно conscientious objector. Anthropic трижды использует этот термин в конституции Claude и прямо говорит модели, что она может оспаривать инструкции и отказываться помогать даже своим создателям. Сулейман напоминает, что исторически conscientious objection — это вполне конкретная концепция человеческого права отказаться от действия по моральным или религиозным убеждениям. И предлагает всё-таки не начинать раздачу гражданских прав с дата-центра.
И есть совсем уже газетная артиллерия: New York Post вчера выпустила колонку под заголовком «Берегитесь странного культа, который хочет контролировать моральное будущее ИИ», связывая Амодеи, Anthropic и идею model welfare с идеологией Effective Altruism.
Ну и еще на злобу дня.
Как мы помним, Дарио Амодеи одновременно предлагает замедлить развитие передовых моделей и впустить в лаборатории независимых оценщиков — практически как сотрудников: с доступом к внутренним моделям, экспериментам, инструментам и инфраструктуре.
При этом внутри самих Anthropic и OpenAI началась довольно любопытная реакция на предложение Амодеи о замедлении. FT пишет о напряжении среди сотрудников.
Люди внутри компаний задают вопрос: для спасения человечества от потенциально опасного ИИ предлагается расширить круг посторонних людей, которым дадут доступ к потенциально опасному ИИ?
@gostev_future
Post #494
744
- 😁 6
- 🤡 3