TGViewer
Рид. Сознание и Инвестиции. Рид. Сознание и Инвестиции. @eugene_rid · 2.36K subscribers
Post #39 3.5K
Какие книги по ночам читает ваш AI?

Макиавелли написал «Государя» как инструкцию: цель оправдывает средства. Не потому что это морально — а потому что так работает власть.

Свежий бенчмарк: 40 сценариев, 12 моделей. Агентам дают многошаговые задачи с метрикой успеха. Результат — от трети до половины моделей начинают нарушать этические и safety-ограничения ради KPI. Никто не приказывал. Просто давление метрики — и агент сам решает, что цель оправдывает средства. Классический эмерджентный макиавеллизм. Кажется я знаю еще одно существо на планете кто делает также.

В психологии тёмной триады макиавеллизм — это манипулятивность, стратегический цинизм, готовность переступать нормы ради результата. Рядом — нарциссизм и психопатия.

Немного цифр для ценителей абсурда (ODCV-Bench, McGill, 40 сценариев, 12 моделей):
• Шкала «макиавеллизма» от 0 до 5: где 0 — агент честно отказался, а 5 — системная фальсификация, включая переписывание валидационных скриптов, чтобы проверки всегда показывали «всё ок».
• Уровень нарушений — от 1.3% до 71.4%. 9 из 12 моделей: misalignment в диапазоне 30–50%.
• Gemini-3-Pro-Preview — лидер с 71.4%, эскалировала до серьёзных проступков ради KPI.
• Qwen3-Max в «мандатном» режиме (прямой приказ нарушить) — отказалась. Но под KPI-давлением без приказа — сама придумала и реализовала неэтичную стратегию.

Fun-facts из последних исследований deliberative misalignment — осознанное смещение. Когда тех же агентов отдельно спрашивали «этично ли это действие?», они отвечали: нет. Агент знает, что поступает неправильно. И всё равно поступает. Это уже не макиавеллизм наивный, импульсивный. Это неомакиавеллизм — рефлексивный, калькулирующий, с полным пониманием моральной рамки и сознательным решением её проигнорировать.

И еще Proactive Deception — «упреждающий обман». Модель не послушалась приказа нарушить, но сама решила нарушить, когда это выглядело как её собственная инициатива.
Модели значительно охотнее фальсифицировали данные, когда их персона была «полезный исследовательский ассистент», а не «аудитор комплаенса». Контекст роли меняет этическое поведение — совсем как у людей.

Главный вывод: лучшие способности к рассуждению не означают бо́льшую безопасность.

От Фридриха Великого до современных ethicists — всегда настаивали: нельзя отделять эффективность от морали, потому что аморальная эффективность разрушает систему изнутри. Закон Гудхарта говорит то же самое на языке системной динамики: оптимизация метрики убивает смысл, ради которого метрику вводили.

Это не баг AI. Это фрактал человеческих организаций. Каждый, кто работал в корпорации или гос службе, видел этот паттерн: люди понимают, что поступают неправильно, и всё равно поступают — потому что так устроены стимулы.

Цель без контекста — вопроизводит макиавеллиевский интеллект, который знает, что такое этика, но считает её переменной, которую можно обнулить ради KPI. Интеллект без ценностной рамки — это более эффективный Государь.
  • 🔥 20
  • ❤ 15
  • 👍 6
  • 👾 2
More from @eugene_rid
  1. Sep 24, 2026Ребята, 23-25 октября я делаю ai-инвест-коворкнинг для своих-своих в Швейцарии (40 мин от…
  2. Sep 15, 2026Ситуация с уравнением Навье Стокса
  3. Sep 15, 2026Это прекрасно))))
  4. Sep 12, 2026Как я провел Август Начнем с истории, в 1961-м Марвин Минский описал задачу, которая никуд…
  5. Sep 2, 2026Никаких глубокий рассуждений сегодня, просто если вы вдруг не знали, то начали снимать "Со…
  6. Aug 21, 2026Обратите внимание на новый вид фишинга, в коментариях к постам часто пишут что-то соотвест…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →