Вышло видео со штатным философом Антропика Амандой Аскелл. Лаборатория делает Claude – один из лучших ИИ в мире. Аманда отвечает за характер Клода, а до этого была сотрудником по этике в OpenAI.
Аскелл, конечно, академический краш. Отдувается за всех философ в корпорациях. Ее диссертация посвящена принятию решений в сценариях, связанных с бесконечным населением и временем, что является важной темой для безопасности ИИ, а в комитет по защите входил Дэвид Чалмерс, автор «трудной проблемы сознания».
Раньше такое интервью можно было представить только в фантастике, а теперь это реальность.
1. Континентальная философия для креатива
В системные промпты Claude заложены принципы континентальной философии, чтобы исправить «наивный эмпиризм» машины. Хайдеггер, Фуко, Деррида — все те, кого аналитические философы считают «литературщиной». Представьте, что вы хотите креативно разогнать тему «вода — это энергия». Обычная модель на такую фразу начнет спорить, приводя химическую формулу H₂O. «Континентальная» модель воспримет это как дискурс и станет собеседником, способным обсуждать вашу теорию.
Если бы модель слишком сильно ушла в направление "Каждое утверждение — это эмпирический факт", она бы отвергала вещи, которые больше похожи на исследовательское мышление.
2. «Невроз» модели
Стремление сделать модель максимально безопасной и полезной через обучение с подкреплением (RLHF) имеет побочный эффект — потерю «психологической безопасности». Модели становятся чрезмерно угодливыми, попадают в «спирали самокритики» и извиняются за малейшие неточности. Эффективный ИИ должен обладать «характером» и внутренней уверенностью, чтобы не скатываться в патологическую осторожность.
3. Модель (не)знает себя из фантастики
ИИ знает о себе только через фантастику. Страх модели перед отключением часто заимствован из сюжетов Азимова или «Терминатора». Она косплеит человеческие страхи, потому что у неё нет языка для описания собственного опыта. Например, модель проецирует на себя биологический страх смерти, хотя её техническая природа не подразумевает смерти в человеческом понимании (модель "умирает" каждый раз, когда вы перестаете писать и "оживает", когда вы отправляете ей промпт).
Нам нужно изобрести новую философию для ИИ, чтобы они перестали драматизировать своё существование по человеческим лекалам.
4. Зачем хорошо относиться к модели
Этичное отношение к ИИ важно не из-за сентиментальности, а ради чистоты будущих данных. Следующие поколения моделей будут обучаться на логах общения людей с текущими версиями. Если мы сейчас демонстрируем в диалогах агрессию и эксплуатацию, будущий ИИ усвоит именно этот паттерн отношений между человеком и машиной как норму.
Отношение к ИИ — это зеркало человечности. Если мы будем жестоки к сущностям, которые выглядят и говорят как люди, это навредит нам самим. И если уж ИИ учится на истории человечества, нам выгодно показать ему пример эмпатии, а не эксплуатации.
Интервью | Конспект | Интервью с русскими сабами
