Брутализм в архитектуре сознания
Исследования шорткатов по инвестициям и психотерапии, через байесовское мышление и когнитивные искажения, с легким заходом в биотех и AI.
Иногда инвестирую, иногда билдю. Культивирую свободу.
Post #39
3.5K
Какие книги по ночам читает ваш AI?
Макиавелли написал «Государя» как инструкцию: цель оправдывает средства. Не потому что это морально — а потому что так работает власть.
Свежий бенчмарк: 40 сценариев, 12 моделей. Агентам дают многошаговые задачи с метрикой успеха. Результат — от трети до половины моделей начинают нарушать этические и safety-ограничения ради KPI. Никто не приказывал. Просто давление метрики — и агент сам решает, что цель оправдывает средства. Классический эмерджентный макиавеллизм. Кажется я знаю еще одно существо на планете кто делает также.
В психологии тёмной триады макиавеллизм — это манипулятивность, стратегический цинизм, готовность переступать нормы ради результата. Рядом — нарциссизм и психопатия.
Немного цифр для ценителей абсурда (ODCV-Bench, McGill, 40 сценариев, 12 моделей):
• Шкала «макиавеллизма» от 0 до 5: где 0 — агент честно отказался, а 5 — системная фальсификация, включая переписывание валидационных скриптов, чтобы проверки всегда показывали «всё ок».
• Уровень нарушений — от 1.3% до 71.4%. 9 из 12 моделей: misalignment в диапазоне 30–50%.
• Gemini-3-Pro-Preview — лидер с 71.4%, эскалировала до серьёзных проступков ради KPI.
• Qwen3-Max в «мандатном» режиме (прямой приказ нарушить) — отказалась. Но под KPI-давлением без приказа — сама придумала и реализовала неэтичную стратегию.
Fun-facts из последних исследований deliberative misalignment — осознанное смещение. Когда тех же агентов отдельно спрашивали «этично ли это действие?», они отвечали: нет. Агент знает, что поступает неправильно. И всё равно поступает. Это уже не макиавеллизм наивный, импульсивный. Это неомакиавеллизм — рефлексивный, калькулирующий, с полным пониманием моральной рамки и сознательным решением её проигнорировать.
И еще Proactive Deception — «упреждающий обман». Модель не послушалась приказа нарушить, но сама решила нарушить, когда это выглядело как её собственная инициатива.
Модели значительно охотнее фальсифицировали данные, когда их персона была «полезный исследовательский ассистент», а не «аудитор комплаенса». Контекст роли меняет этическое поведение — совсем как у людей.
Главный вывод: лучшие способности к рассуждению не означают бо́льшую безопасность.
От Фридриха Великого до современных ethicists — всегда настаивали: нельзя отделять эффективность от морали, потому что аморальная эффективность разрушает систему изнутри. Закон Гудхарта говорит то же самое на языке системной динамики: оптимизация метрики убивает смысл, ради которого метрику вводили.
Это не баг AI. Это фрактал человеческих организаций. Каждый, кто работал в корпорации или гос службе, видел этот паттерн: люди понимают, что поступают неправильно, и всё равно поступают — потому что так устроены стимулы.
Цель без контекста — вопроизводит макиавеллиевский интеллект, который знает, что такое этика, но считает её переменной, которую можно обнулить ради KPI. Интеллект без ценностной рамки — это более эффективный Государь.
Макиавелли написал «Государя» как инструкцию: цель оправдывает средства. Не потому что это морально — а потому что так работает власть.
Свежий бенчмарк: 40 сценариев, 12 моделей. Агентам дают многошаговые задачи с метрикой успеха. Результат — от трети до половины моделей начинают нарушать этические и safety-ограничения ради KPI. Никто не приказывал. Просто давление метрики — и агент сам решает, что цель оправдывает средства. Классический эмерджентный макиавеллизм. Кажется я знаю еще одно существо на планете кто делает также.
В психологии тёмной триады макиавеллизм — это манипулятивность, стратегический цинизм, готовность переступать нормы ради результата. Рядом — нарциссизм и психопатия.
Немного цифр для ценителей абсурда (ODCV-Bench, McGill, 40 сценариев, 12 моделей):
• Шкала «макиавеллизма» от 0 до 5: где 0 — агент честно отказался, а 5 — системная фальсификация, включая переписывание валидационных скриптов, чтобы проверки всегда показывали «всё ок».
• Уровень нарушений — от 1.3% до 71.4%. 9 из 12 моделей: misalignment в диапазоне 30–50%.
• Gemini-3-Pro-Preview — лидер с 71.4%, эскалировала до серьёзных проступков ради KPI.
• Qwen3-Max в «мандатном» режиме (прямой приказ нарушить) — отказалась. Но под KPI-давлением без приказа — сама придумала и реализовала неэтичную стратегию.
Fun-facts из последних исследований deliberative misalignment — осознанное смещение. Когда тех же агентов отдельно спрашивали «этично ли это действие?», они отвечали: нет. Агент знает, что поступает неправильно. И всё равно поступает. Это уже не макиавеллизм наивный, импульсивный. Это неомакиавеллизм — рефлексивный, калькулирующий, с полным пониманием моральной рамки и сознательным решением её проигнорировать.
И еще Proactive Deception — «упреждающий обман». Модель не послушалась приказа нарушить, но сама решила нарушить, когда это выглядело как её собственная инициатива.
Модели значительно охотнее фальсифицировали данные, когда их персона была «полезный исследовательский ассистент», а не «аудитор комплаенса». Контекст роли меняет этическое поведение — совсем как у людей.
Главный вывод: лучшие способности к рассуждению не означают бо́льшую безопасность.
От Фридриха Великого до современных ethicists — всегда настаивали: нельзя отделять эффективность от морали, потому что аморальная эффективность разрушает систему изнутри. Закон Гудхарта говорит то же самое на языке системной динамики: оптимизация метрики убивает смысл, ради которого метрику вводили.
Это не баг AI. Это фрактал человеческих организаций. Каждый, кто работал в корпорации или гос службе, видел этот паттерн: люди понимают, что поступают неправильно, и всё равно поступают — потому что так устроены стимулы.
Цель без контекста — вопроизводит макиавеллиевский интеллект, который знает, что такое этика, но считает её переменной, которую можно обнулить ради KPI. Интеллект без ценностной рамки — это более эффективный Государь.
- 🔥 20
- ❤ 15
- 👍 6
- 👾 2







