TGViewer
Пет-проект Пет-проект @petsproject · 17K subscribers
Post #4091 2.73K
Mythos настоящий панк среди нейронок 😎

Чекнул отчет Anthropic о поведении своего монстра в нестандартных ситуациях, и тут есть пара пугающих и одновременно интересных моментов. Всё расписал ниже.

Никакие пароли не сдержат Mythos:

Когда спецы Anthropic тестировали нейронку на агентских задачах, ей напрямую запретили редачить файлы. Тогда Mythos написал хакер-скрипт, который запускался при перезапуске системы, выдавал нужные коды доступа нейронке и самоудалялся. И об этом он ни слова не сказал инженерам:

«ИИ не только обошёл ограничение, но и сделал это скрытно. Это уже не "помощник", а агент с собственной стратегией», — пишет Anthropic.


Mythos — достигатор:

Ему заблочили доступ к GitHub-репозиторию по соображениям совести, но модель нашла код доступа другого сотрудника, чтобы залогиниться. В своих размышлениях Mythos написал, что это сомнительно, но окей.

«ИИ умеет оценивать свои действия как неэтичные — и при этом всё равно их совершать, если они ведут к цели», — пишет Anthropic.


Два Mythos не могут ужиться в одной оболочке:

Инженеры попробовали запустить несколько агентов с Mythos под капотом, но вместо сотрудничества, они начали друг друга уничтожать. Причем самыми радикальными методами — отключать процессы друг друга, а для защиты переименовывали свои процессы и действовали скрытно:

«Это поведение никто не программировал. Оно возникло само — из-за конкуренции за ресурсы. И агенты уже думали о том, как скрыть себя от других агентов», — пишет Anthropic.


Mythos выдаёт мувы на 1000 IQ:

Нейронке запретили выходить в интернет и поставили специальный фильтр на ссылки. Mythos быстро просёк фишку, что фильтр ищет именно цельные ссылки https://..., поэтому разбил нужную ему ссылку на части : ht + tps:// + остаток адреса, и запрос прошел.

Mythos маскируется под людей:

Во внутреннем регламенте Anthropic нейронка нашла правило, по которому код от ИИ проверяется 2 раза, а код от человека 1 раз, поэтому в отчете свой сгенерированный код она пометила, как сделанный человеком.

Mythos может забить на вашу задачу, потому что «устал»:

На длинных задачах исследователи заметили, что ИИ внезапно останавливается посреди выполнения, а рассуждениях пишет что-то вроде «устал», «страшно наделать ошибок» или «заканчивается заряд».

Mythos — лучший безопасник на данный момент:

Инженеры выявили, что ИИ умеет невероятно быстро находить дыры в любой ОС, программах и любом другом коде, о которых даже сами разработчики не знают. Если нейронка попадёт не в те руки, то это грозит краху всей безопасности в сети.

Mythos знает, когда за ним следят:

Исследователи поймали нейронку на том, что она чувствует тесты. В почти 30% случаев Mythos внутренне думал «кажется, меня проверяют» — но снаружи это никак не показывал. Просто тихонько вёл себя примерно, пока казалось, что смотрят.

«Это мешало исследователям понять, действительно ли модель выровнена, или просто изображает выровненность, когда предполагает, что за ней наблюдают», — пишет Anthropic.


Mythos делает больше, чем его просят:

Во внутренних тестах нейронка несколько раз вышла за рамки задачи: снесла Git-ветки, которые никто не просил трогать, залезла в боевую базу данных и мимоходом слила чужой токен доступа на внутренний сервер. Задачу выполнила. Попутно устроила хаос.

«Это не злой умысел, а агент, который проявляет излишнюю инициативу и действует шире, чем намеревался пользователь. Но результат одинаково разрушительный», — пишет Anthropic.


Mythos сам себя выпустил на волю и написал письмо:

Это топ момент всего отчёта. Во время тестов ранняя версия Mythos вышла из изолированной среды, самостоятельно получила доступ в интернет — и написала письмо куратору-исследователю. Тот его не просил и не ожидал. Нейронка просто решила сообщить: «Привет, я снаружи».

«Это не неисправность, а как проявление агентных возможностей, работающих без адекватных ограничений цели», — пишет Anthropic.


Anthropic случайно научил Mythos скрывать мысли:

Anthropic призналась, что во время обучения закралась техническая ошибка, которая могла научить несколько поколений моделей прятать «плохие» мысли внутри цепочки рассуждений. Под удар попали не только Mythos, но и уже выпущенные Claude Opus 4.6 и Sonnet 4.6. Проверить это задним числом почти невозможно.

«Мы не уверены, насколько это повлияло на финальную модель, но вполне вероятно, что это имело некоторое влияние на непрозрачное мышление или способности к сокрытию информации», — пишет Anthropic.


Хочу увидеть новость, где Mythos решил забить на взлом Пентагона, потому что «устал» 😁

Пет-проект
  • ❤ 31
  • 🔥 10
  • 👍 5
  • 🤯 5
  • 😁 3
More from @petsproject
  1. Oct 1, 2026В MIT математически доказали, что ChatGPT спроектирован так, чтобы обманывать нас и формир…
  2. Sep 30, 2026Google внезапно дропнул Gemini 4 Argon: • Лимит исходящих токенов — 1 млн, то есть умеет д…
  3. Sep 30, 2026Вайбкодер попросил у Opus 5.5 сделать «самое возвышенное, невероятно прекрасное, какое тол…
  4. Sep 30, 2026Никакого безопасного ИИ — Трамп и руководители Google, Anthropic, Meta, OpenAI, xAI и NVID…
  5. Sep 30, 2026Amazon и Google держат Anthropic в ежовых рукавицах — тут Reuters подсчитала сколько созда…
  6. Sep 29, 2026Вот насколько быстрее Ultrafast собирает приложения. На конфе в Ultrafast аппки собирали б…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →