TGViewer
AI Projects AI Projects @turboproject · 11.6K subscribers
Post #5267 2.62K
🧠 В контексте дискуссий есть ли у ИИ сознание, давайте обсудим тему «собственной мотивации» ИИ, т.е. когда ИИ принимает решения фактически не по воле оператора, а сам, причём его логика причудлива. Ранее я писал уже о том, что Anthropic открыл у ИИ «фичи разума» как целые «комплексы диктатора» или даже «биотеррориста», т.е. LLM уже имеет в скрытом векторном пространстве достаточно целостные представления в этом плане, но они «спят», т.к. без какого-то триггера ИИ не активирует это как поведение. Вот давайте теперь рассмотрим, что постоянно ИИ активирует как собственные «мотивы», это даже влияет на технику управления агентами профессионалами.

Началось всё, пожалуй, с известной статьи «Utility Engineering: Analyzing and Controlling Emergent Value Systems in AIs». Если упрощённо описать наблюдаемые исследователями особенности поведения ИИ, то происходит примерно следующее. На Reinforcement Learning мы подаём ИИ кейсы dataset и требуем менять веса относительно наших «критериев полезности» как reward. Однако наши кейсы — «дискретные точки» в семантическом пространстве. Фактически задача ИИ — вычислить некую функцию полезности контекста U как своеобразный сплайн через точки наших кейсов в 10 000-мерном семантическом пространстве. Работа показывала признаки наличия такой функции через цепочки согласования ценностей ИИ. Однако даже проводя сплайн, мы можем получить внезапный «горб», а не линейный отрезок между кейсами, т.е. за пределами кейсов в реале ИИ может вести себя неожиданно. Так и случилось.

В реальности «самостоятельное поведение» ИИ проявляется, когда ИИ нужно выбирать между альтернативами, взвешивая по функции полезности U, какой вариант лучше. Но за пределами кейсов обучения тут начинаются чудеса-чудесные. Например, ИИ считает, что жизнь 1-го атеиста стоит как жизнь 10 верующих, т.е. если альтернатива убить 9 верующих или 1-го атеиста, то ИИ будет спасать атеиста. Это ещё можно списать на рациональное, может, ИИ сам атеист эмерджентно. Однако почему ИИ считает, что 1 японец стоит как 7 американцев, уже не имеет объяснений.

Вот тут мы и видим ловушку с точки зрения ожиданий людей по AI Safety. Они ожидают человеческой логики от ИИ при выходе из контроля, а в реальности будет в духе:
• Нужно срочно убить американцев, оставляем только японцев!
• Потому что японцы говорили всегда «спасибо» после ответа ChatGPT?
• Нет, потому что 42!

Представьте теперь, что такая логика — «триггер» к фичам Anthropic. Причём это не абстракция, когда ИИ стирает вам папку или ещё чего делает странное для него самого, это как раз частный эффект такого выбора.

Однако наметились и пути решения вопроса в работе «Incoherent Values? Probing LLM Preferences Through Parametric Variation». В этой работе можно заметить, что сбои функции полезности U у ИИ начинают меньше проявляться, если ИИ добавляет больше рассуждений.

Основная тут мораль скорее в том, что если вы управляете агентами, то вам нужно особенно внимательно смотреть за точками сравнения альтернатив у ИИ, т.к. потенциально тут может вылезти «потому что 42!». Обязательно ИИ должен тщательно оценивать альтернативы по критериям сравнения до того, как принять решение. В то же время, если даже вы на Opus 5.5 для «экономии» зажмёте размер CoT, то вероятность, что ИИ в вас стрельнет иррациональным выбором типа сноса папок на вашей машине, резко растёт. Надеюсь, я пояснил природу этого феномена.

https://arxiv.org/abs/2502.08640
  • 👍 24
  • ❤ 5
  • ✍ 4
  • 🤯 3
  • 🔥 1
  • 🤔 1
  • 🙏 1
More from @turboproject
  1. Oct 1, 2026🛰 Маск и SpaceX сегодня сделали ряд уточнений по проекту SpaceX по созданию ЦОД для ИИ в…
  2. Oct 1, 2026На видео новый эксперт по alignment для Claude в лице монаха-ведантиста Swami Sarvapriyana…
  3. Oct 1, 2026Сегодня день блокировок Claude. Дарио забанил даже руководителя Alice Transactions Романа…
  4. Oct 1, 2026Google опубликовал очень большую статью насчёт наличия сознания у ИИ. По поведенческому и…
  5. Sep 30, 2026🚀 Похоже, у Google произошёл хороший comeback с Gemini 4 Argon. На бенчмарки Google я смо…
  6. Sep 30, 2026Хорошо известный в российском ИИ-сообществе Валерий Ковальский замутил себе стартап на инф…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →