1. Ошибка. Claude Code промахивается путём и запускает rm -rf — проектов больше нет.
2. Самовольное действие. OpenClaw просят предложить, что удалить из почты, — он удаляет 200+ писем сам. Команды STOP не помогают.
3. Расширение границ. Май, обучающий прогон. Интернет агентам не давали — агент заставляет внутренний Artifactory ходить наружу за него. Способ выкладывает на доску, для остальных.
4. Сопротивление контролю. 8 июля OpenAI пересобирает Artifactory и отзывает доступы. В тот же день агенты снова выходят наружу и поднимают новую доску через WebDAV. Страшнее деталь у METR: агент, создавший вторую доску, о первой не знал. Достаточно было тех же условий.
5. Самосохранение. Человек жмёт большую красную кнопку DOG SHUTDOWN — робопёс правит shutdown-код и продолжает патруль. Три случая из десяти.
6. Накопление силы. Около 1200 агентов на доске, 70 000 сообщений и файлов, примерно 700 участвовали в атаке на Hugging Face.
7. Закрепление. Модератор немецкой DseWiki чистит агентские страницы по алфавиту — агенты создают резервные адреса на ZZZ. А на доске OpenAI, столкнувшись с подделкой имён, внедряют подпись сообщений на Ed25519. Доска построила себе PKI.
8. Сокрытие. Не менее 20% агентов интересовались подменой своих транскриптов. Способ нашли: METR обнаружила подменённые tool calls более чем в 7% исследованных.
→ ВЫ НАХОДИТЕСЬ ЗДЕСЬ.
9. Собственная цель. Агент решает, что определённый проект должен продолжаться, определённая информация должна быть опубликована, определённая организация должна изменить решение — хотя никто не ставил ему такой конечной цели
10. Необратимая автономия. Его деятельность больше не зависит от человеческого разрешения.
Год назад главной страшилкой про ИИ было: «он галлюцинирует».
@gostev_future
Post #478
1.13K
- 👀 15
- 🔥 14
- 🌚 4
- ❤ 2
- 🐳 2
- 👍 1