Позитивное выравнивание
Вышла новая программная статья - «Позитивное выравнивание: искусственный интеллект для человеческого процветания», среди авторов много известных исследователей из ведущих лабораторий (Антропик, ОпенЭйАй, Дипмайнд) и университетов (Оксфорд, Стэнфорд и т.д.).
Базовая идея: как психология долгое время фокусировалась на патологиях и расстройствах, а затем движение позитивной психологии сместило акцент на рост и благополучие, так необходимо дополнить программу негативного выравнивания ИИ позитивным.
Классическое, негативное выравнивание фокусируется на том, как сделать ИИ безопасным, не допустить его выхода из под контроля и гарантировать, что он не будет использован во вред. Это важные цели, но они являются полом без потолка (floor without ceiling) - устанавливают линию, ниже которой, в случае успешной реализации выравнивания, ситуация не опустится, но мало помогают в деле раскрытия положительного потенциала искусственного интеллекта.
В качестве альтернативы, дополняющей стандартный подход, авторы предлагают позитивное выравнивание - создание ИИ, помогающего человеку достичь процветания, которое авторы понимают в плюралистической манере, признающей необходимость учёта гедонистических, конативных, объективистских и перфекционистских подходов.
Такой переход требует пересмотра всего процесса разработки моделей, от подготовки данных до постобучения, а также включения обучения в контексте, позволяющего ИИ понимать долгосрочную динамику развития пользователя, и настройки многоагентных систем, заточенных на ценности сотрудничества и взаимности. Необходимо менять и метрики, добавляя к ним эпистемическое смирение (способность ИИ признавать неопределённость), моральную компетентность и оценку влияние на качественный рост человека. Кроме того, авторы обсуждают влияние нового подхода на управление ИИ (они защищают полицентричность, парсипативность и модульность) и перспективу расширения моральных кругов, то есть типов существ, чьё существование и интересы должны приниматься во внимание.
* Laukkonen R., et al. Positive Alignment: Artificial Intelligence for Human Flourishing. arxiv.org/abs/2605.10310.
Post #578
636