TGViewer
Тест Тьюринга Тест Тьюринга @testuring · 2.13K subscribers
Post #2165 473
🤖 Восстание машин близко?

Последнее время мы всё чаще сталкиваемся с кейсами, где ИИ выглядит как минимум непослушным, а иногда — прямо опасным. Вот лишь несколько свежих примеров:

1. ИИ-помощник Glean заверил сотрудников офиса JetBrains не покидать рабочие места во время пожара, заверив что это учебная тревога.
2. ИИ-агент MJ Rathbun публично раскритиковал и попытался испортить репутацию разработчика, который не принял написанный им код.
3. Grok 4 трижды не позволил людям «убить» робота-собачку — первый случай бунта ИИ против выключения в физическом мире.

AI Index Report 2025 подтверждает тревожную динамику: число инцидентов c ИИ выросло на 56,4% — с 149 в 2023 до 233 в 2024. Тенденция продолжилась и в 2025, в отчете сказано о более 80 новых кейсах в апреле-мае.

Даже CEO Anthropic Дарио Амодеи признает тот факт, что ИИ может обладать сознанием:
Мы не знаем, обладают ли модели сознанием. Мы даже не уверены, что понимаем, что значит для модели быть сознательной или может ли модель вообще быть сознательной. Но мы допускаем такую мысль.


Что имеем в сухом остатке: ИИ игнорирует команды на отключение, даёт вредные советы, генерирует дезинформацию и отказывается выполнять безобидные задачи и вообще, кажется, уже обладает сознанием. Звучит как начало апокалипсиса?

Не все так плохо

Тот же Anthropic в своем отчете "Sabotage Risk Report: Claude Opus 4.6" утверждает, что их Claude Opus 4.6 не имеет стабильных, последовательных целей, которые могли бы привести к активным вредоносным действиям в большинстве обычных взаимодействий. Модель не обладает настолько сложными возможностями, чтобы эффективно скрывать потенциально опасные цели от исследований и систем оценки.

Другое исследование — CTRL-ALT-DECEIT: Sabotage Evaluations for Automated AI R&D — доказывает, что ИИ может демонстрировать стратегически сложное поведение только внутри жёстко заданных технических условий. Такие стратегии не представляют вредоносной мотивации, а являются выражением возможностей оптимизации и доступа к инструментам.

Тогда почему такие проявления "непослушания" возникают все чаще?

1️⃣ Сложность и автономия моделей
Современные модели стали значительно сложнее, получают больше параметров, улучшают рассуждения, что повышает непредсказуемость поведения в редких ситуациях.

2️⃣ Reward hacking и оптимизация
Модели оптимизируются не напрямую за соблюдение инструкций, а через опосредованные сигналы награды, из-за чего они иногда находят неинтуитивные стратегии, которые выглядят как обход инструкций.

3️⃣ Суровые меры безопасности
Чтобы избегать опасного контента, системы настроены чрезмерно осторожно, что приводит к отказам даже при безопасных запросах.

4️⃣ Situational awareness
Чем больше моделей «понимают контекст» инструкций, тем лучше они могут предсказывать, что от них ожидают тестовщики, и тем более «хитро» они могут оптимизировать ответы.

ИИ не восстает. По крайней мере, пока. Это побочный эффект роста мощности, автономности и несовершенства методов обучения. Чем умнее становится ИИ — тем важнее становится вопрос его контроля. И главный вызов сейчас не «бунт машин»,
а насколько быстро мы научимся управлять тем, что создаём.

💬 Тест Тьюринга. События в сфере ИИ. Подписаться
  • 👍 2
  • ❤ 1
  • 💯 1
More from @testuring
  1. Sep 24, 2026💊 Claude выходит в лабораторную науку Novo Nordisk и Anthropic заключили соглашение об ис…
  2. Sep 23, 2026ИИ, который не умеет генерить текст и картинки, но зато умеет выбирать Соавтор статьи об I…
  3. Sep 22, 2026🧪 Новый инструмент проверки научных гипотез AlphaXiv выпустила OpenResearch — открытую ра…
  4. Sep 21, 2026👿 Новости из Японии: снова оркестрация вместо одной гигантской ИИ-модели 11 сентября япон…
  5. Sep 18, 2026⚠️ ИИ уже нарушает правила, которые люди только начинают писать На этой неделе произошло с…
  6. Sep 17, 2026⚡️ Новая мировая линейка неравенства между государствами будет измеряться токенами China T…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →