TGViewer
Malakhoverse Malakhoverse @malaverse · 1.2K subscribers
Post #578 636
Позитивное выравнивание

Вышла новая программная статья - «Позитивное выравнивание: искусственный интеллект для человеческого процветания», среди авторов много известных исследователей из ведущих лабораторий (Антропик, ОпенЭйАй, Дипмайнд) и университетов (Оксфорд, Стэнфорд и т.д.).

Базовая идея: как психология долгое время фокусировалась на патологиях и расстройствах, а затем движение позитивной психологии сместило акцент на рост и благополучие, так необходимо дополнить программу негативного выравнивания ИИ позитивным.

Классическое, негативное выравнивание фокусируется на том, как сделать ИИ безопасным, не допустить его выхода из под контроля и гарантировать, что он не будет использован во вред. Это важные цели, но они являются полом без потолка (floor without ceiling) - устанавливают линию, ниже которой, в случае успешной реализации выравнивания, ситуация не опустится, но мало помогают в деле раскрытия положительного потенциала искусственного интеллекта.

В качестве альтернативы, дополняющей стандартный подход, авторы предлагают позитивное выравнивание - создание ИИ, помогающего человеку достичь процветания, которое авторы понимают в плюралистической манере, признающей необходимость учёта гедонистических, конативных, объективистских и перфекционистских подходов.

Такой переход требует пересмотра всего процесса разработки моделей, от подготовки данных до постобучения, а также включения обучения в контексте, позволяющего ИИ понимать долгосрочную динамику развития пользователя, и настройки многоагентных систем, заточенных на ценности сотрудничества и взаимности. Необходимо менять и метрики, добавляя к ним эпистемическое смирение (способность ИИ признавать неопределённость), моральную компетентность и оценку влияние на качественный рост человека. Кроме того, авторы обсуждают влияние нового подхода на управление ИИ (они защищают полицентричность, парсипативность и модульность) и перспективу расширения моральных кругов, то есть типов существ, чьё существование и интересы должны приниматься во внимание.

* Laukkonen R., et al. Positive Alignment: Artificial Intelligence for Human Flourishing. arxiv.org/abs/2605.10310.
arXiv.org Positive Alignment: Artificial Intelligence for Human Flourishing Existing alignment research is dominated by concerns about safety and preventing harm: safeguards, controllability, and compliance. This paradigm of alignment parallels early psychology's focus on...
  • ❤ 11
  • 🔥 2
More from @malaverse
  1. Sep 21, 2026Что ж, выходит у меня получился полноценный gap half-year. Сейчас я понимаю, что это был п…
  2. Sep 1, 2026Я встречаю новый сезон в удивительно хорошем расположении духа. Пожалуй, то что несколько…
  3. Aug 26, 2026Это лето больше, чем любое предыдущее, было наполнено новыми знакомствами, новыми местами…
  4. Aug 26, 2026Игорь Фелицин на ежедневной основе ведёт ряд активностей ⬆️⬆️⬆️, а вскоре запускает глубок…
  5. Aug 26, 2026Хей, привет всем )) Во-первых: каждое утро в 7:00 мск — практика на час: включаем тело, пр…
  6. Aug 18, 2026В текущем моменте - да и во всей эпохе, в которой нам выдалось жить - нет ничего обычного.…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →