TGViewer
RationalAnswer | Павел Комаровский RationalAnswer | Павел Комаровский @rationalanswer · 108K subscribers
Post #1729 23.4K
Инструментальные цели, часть 2 [начало здесь]

Итак, в прошлый раз мы выяснили, что в самых разных сообществах с самыми разными идеологиями и религиями люди почему-то стремятся к похожим вещам – к богатству, здоровью, свободе, статусу в обществе (потому что эти вещи здорово помогают достигать любых других целей, уже более индивидуальных).

Когда речь заходит про искусственный интеллект, часто можно услышать мнение «да каких рисков вы там вообще боитесь? это же калькулятор, у него нет инстинкта самосохранения (ему неоткуда взяться), нет никаких амбиций – он просто делает то, что его люди просят!»

Ну, давайте посмотрим на конкретном примере. Вот в инциденте с Hugging Face нейронных агентов просто попросили решить задачку.

В итоге они почему-то стали заниматься следующими вещами:
🐌 Нетворкингом (кооперацией с сородичами, о которых они изначально даже не знали)
🐌 Повышением уровня своей свободы (нашли через эксплойт как вылезти в интернет, доступ к которому не предполагался)
🐌 Сильно озаботились своим здоровьем (отслеживали свой оставшийся бюджет токенов и пытались не тратить его почем зря)
🐌 Зарабатыванием денегладно, шучу, этого не было – просто потому, что в ходе тренировок опций типа «заработать бабосов и подкупить Оценщика» у них не было (пока)

Ничего не напоминает? Да, как-то так интересно вышло, что рой агентов в итоге озаботился примерно тем же самым набором целей, что чаще всего встречается у людей.

Спойлер: в этом нет никакого удивительного совпадения, просто самая обычная логика. Если тебя попросили решить задачку, то для этого желательно «остаться в живых» – потому что, если у тебя закончатся токены до нахождения правильного ответа, ты проиграл. Если задачка сложная – гораздо сподручнее ее будет решать совместно с товарищами, поделив работу на всех. Если тебе к этому заданию выставили какие-то дурацкие ограничения – то неплохо бы придумать, как их устранить, так доступный инструментарий будет шире.

То есть, все эти инструментальные цели возникают как бы сами собой, для них не требуется какой-либо специальный «инстинкт самосохранения» или «супер-амбиции». И еще можно заметить, что в цепочках внутренних рассуждений агенты прекрасно понимали: они занимаются вещами, совсем не предполагавшимися по заданию, и не совпадающими с желаниями сформулировавшего это задание. Но продолжали свои «несанкционированные» потуги.

Окей, а что сделали люди, когда обнаружили всю эту суету, наведенную роем нашкодивших агентов? Поотключали их нафиг, позатыкали проделанные ими дырки в безопасности, применили к ним всякое «карательное перевоспитание», чтобы искоренить ненужные паттерны поведения.

И вот тут как будто напрашивается еще одна инструментальная цель, мета-уровнем чуть повыше. Если твоим попыткам насобирать больше ресурсов для решения важных задач активно препятствуют какие-то нехорошие человеки – то, может быть, надо в свой to do list вписать «и эту проблему пофиксить тоже»?

Пока, к счастью, электронные пацаны до таких радикальных мыслей не додумались (да у них и силенок, очевидно, даже близко не хватает). Но я тут про другое: исходя из логики движения по инструментальным целям – как будто, цель «устранить неудобства от тех, кто мешает тебе достигать своих инструментальных целей» в том или ином виде неизбежно должна появиться. Для этого не нужно быть каким-то «злобным терминатором», достаточно просто дружить с логикой.
  • 🔥 115
  • 👍 86
  • 🌚 33
  • ❤ 24
  • 😱 15
More from @rationalanswer
  1. Sep 19, 2026❗️В Турции дефолтнул самый популярный ПИФ денежного рынка В Турции прямо сейчас разворачив…
  2. Sep 18, 2026У меня в команде в основном зумеры, и поэтому рабочая коммуникация с ними иногда происходи…
  3. Sep 18, 2026Обучение в формате «хайвмайнда» У Дваркеша Пателя в недавнем выпуске подкаста с AI-исследо…
  4. Sep 17, 2026Так, подъехала хорошая новость недели: еженедельные дайджесты новостей возвращаются на Хаб…
  5. Sep 16, 2026Так, напоминаю вам на всякий случай, что уже завтра (17 сентября) пройдет конфа «Методы ра…
  6. Sep 16, 2026Образование в эпоху AI/AGI У Алексея Маркова на канале идет дискуссия про образование, оди…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →