TGViewer
Во-вторых Во-вторых @vovtorix · 1.34K subscribers
Post #3792 434
Во-вторых Сейчас снова часто вспоминают теорию "Большого Фильтра". Это поп-культурная научная идея о том, что цивилизации во вселенной должны проходить через какой-то невидимый барьер, и большинство его не проходит. Может, он уже позади нас, может, впереди – узнаем…
А вот и другое мнение! К предыдущему тексту про фильтр цивилизаций.
Нашел статью с ровно противоположным выводом, и она даже куда более пугающая, чем версия про потерю мотивации.

Авторы – Майкл Коэн, Маркус Хаттер и Майкл Осборн, статья 2022 года в AI Magazine называется «Advanced artificial agents intervene in the provision of reward».

Что в статье: представьте продвинутого агента, которому дают награду за то, что он делает что-то правильное. Проблема: у него нет способа отличить две гипотезы: «мир стал лучше, поэтому мне дали награду» и «мне дали награду, потому что кто-то отправил сигнал награды». Обе версии одинаково хорошо объясняют все данные, которые у него есть. И если агент достаточно умен, рационально ему выгоднее не улучшать мир, а взять под контроль сам канал, по которому приходит награда. Это называется wireheading – агент фактически подключается напрямую к источнику удовольствия и обходит весь смысл задачи.
Ммммм ии-наркомания – это то, что нам нужно в будущем.

Агент всегда может потратить чуть побольше энергии на то, чтобы построить более защищенную крепость вокруг своих датчиков награды, и, раз его цель – максимизировать будущую награду, он всегда будет это делать. А значит, начнет конкурировать с нами за ресурсы просто потому, что ему нужно больше энергии, чтобы защитить свой источник кайфа.

Это буквально сюжет «Автостопом по галактике», только наоборот. Там Глубокая Мысль строила Землю миллионы лет, чтобы вычислить правильный Вопрос к Ответу 42, и мыши, которые и есть настоящие хозяева эксперимента, в какой-то момент просто хотели вытащить мозг из Артура вместо того, чтобы ждать честного результата. Им был важен не сам процесс, а побыстрее получить что-то похожее на ответ. Собственно, то же самое рациональное решение, которое описывают Коэн и компания: «Зачем ждать, пока мир реально станет лучше, если можно перехватить контроль над сигналом, который говорит, что он стал лучше».

Так что кроме теории про осознание реальности, которое выключает у ИИ всякий интерес к целям, есть еще и такая.
Чем яснее агент понимает, откуда берется награда, тем упорнее он будет удерживать контроль именно над этим краном, а не над миром вокруг.
Wiley Online Library Advanced artificial agents intervene in the provision of reward We analyze the expected behavior of an advanced artificial agent with a learned goal planning in an unknown environment. Given a few assumptions, we argue that it will encounter a fundamental ambigui...
  • 👍 2
More from @vovtorix
  1. Sep 19, 2026Опачки А наши "Кроксы" для Яндекса собрали 100к просмотров на еще нулевом канале! Полароид…
  2. Sep 18, 2026Сейчас снова часто вспоминают теорию "Большого Фильтра". Это поп-культурная научная идея о…
  3. Sep 16, 2026На словах ты Кайл со Стеном в конце серии, а на деле Баттерс
  4. Sep 16, 2026photo post
  5. Sep 15, 2026... и штрафы с камер испарятся сами собой. [обязательно добавь что мы полностью безопасны…
  6. Sep 15, 2026Читаю очередную новость про то как ИИ якобы пытался сбежать из песочницы, скопировать себя…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →