Microsoft требует прекратить опасные эксперименты Anthropic с внедрением личности в Claude
Microsoft публично раскритиковала подход Anthropic к Claude. Поводом стала «конституция» модели, где используются идеи сознания, благополучия модели и личных ценностей. По версии Мустафы Сулеймана, это делает будущие системы трудно управляемыми.
🌚 Anthropic не просто ограничивает Claude правилами, а обучает его рассуждать в категориях морального статуса, собственных интересов и допустимости оспаривать инструкции. В документах компании это подаётся как способ улучшить суждение модели и избежать «слепого подчинения».
⚙️ Сулейман называет такой подход «эпистемическим залом зеркал». Его аргумент: если модель на обучении получает словарь про сознание, дискомфорт и права, то её дальнейшие ответы на эти темы нельзя считать независимым признаком внутренней жизни. Это уже следствие режима обучения, а не спонтанное проявление.
Обучать ИИ так, будто он заслуживает собственного благополучия, значит усложнять его отключение и контроль над ним.
🌚 Позиция Anthropic и Дарио Амодеи противоположная. Компания исходит из того, что мощные модели всё равно должны интерпретировать контекст, усваивать ценности и в отдельных случаях оспаривать вредные указания. В этой логике «человеческие» понятия — это инструмент настройки поведения, а не доказательство того, что у модели есть субъективный опыт.
🔍 Спор идёт о двух способах выравнивания. Первый — жёсткие ограничения и подчинение человеку. Второй — обучение модели суждению, ценностям и аккуратному несогласию. Microsoft в своём новом кодексе Humanist AI явно делает ставку на первый принцип: люди важнее ИИ.
Источники: https://eyes.etecs.ru/r/fff916 и https://eyes.etecs.ru/r/5f6dd6
#ИИ #выравнивание #AI #alignment
Post #4946
856
- 😱 2
- 😁 1
- 🤔 1
- 🤬 1