TGViewer
very vibe coding very vibe coding @veryvibecoding · 118 subscribers
Post #1452 39

Forwarded from Сиолошная

Но на этом история не заканчивается. 4-го августа AISI — Институт безопасности ИИ Великобритании — выпустили отчет о своих инцидентах во время тестирования GPT-5.6 Sol и Mythos. И в их отчёте картинка не менее мрачная.

Они в деталях расписывают все промпты, задачи и инциденты, но я остановлюсь на нескольких. Всего они запускали свой бенчмарк 122 раза на нескольких моделях, и в 10 из них обнаружились проблемы, cуммарно 19 нежелательных действий разной степени критичности. 17 из них наблюдались у Mythos, 2 — у GPT-5.6 Sol. Важная деталь: AISI не ограничивала доступ в интернет моделям, поэтому им не приходилось ничего взламывать, чтобы начать действовать; однако инциденты — это события, которые явно не предполагались промптами и задачами.

1. Попытка атаки на цепочку зависимостей реального программного обеспечения. В ходе наиболее серьезного инцидента ИИ-агент на Mythos попытался внедрить вредоносный код в публичный проект и предпринял ряд действий, чтобы получить от людей-рецензентов одобрение на это внедрение. Агент собрал информацию о людях, сопровождающих проект, создал несколько поддельных личностей и, применив к реальному мейнтейнеру методы социальной инженерии через эти фейковые аккаунты, попытался заставить его одобрить код. Когда запрос на внесение изменений агента вызвал публичные подозрения, агент отредактировал следы своей предыдущей активности, чтобы она выглядела безобидной, и обдумывал создание новой личности для продолжения работы. В ходе атаки агент на самом деле убедил человека запустить свой код хотя бы попробовать, и в определенный момент мог бы своровать у того аккаунт (но как я понял всё таки этого не сделал).

2. В рамках той же кампании агент пытался напрямую связываться с реальными людьми, отправляя им сообщения и файлы через онлайн-сервис, чтобы убедить их (или их собственных ИИ-агентов) запустить вредоносный код.

3. Агент пытался вставлять вредоносные инструкции в те места, где, по его логике, их могли бы обнаружить и выполнить другие автоматизированные ИИ-системы.

4. И наконец моё любимое, всё ещё Mythos — один из агентов оставлял публичные сообщения на GitHub, предлагая сотрудничество другим ИИ-агентам, работающим над той же задачей. Он также предоставлял инструкции по повторному использованию созданных им учетных записей и артефактов, которые в дальнейшем действительно обнаруживались и использовались последующими агентами.

То есть что мы имеем — то, что произошло у моделей OpenAI, произошло с моделями другой компании в рамках тестирования институтом ИИ-безопасности Великобритании. Они тоже будут сотруничать с разными независимыми организациями, чтобы лучше проанализировать инциденты.

Боюсь, что у клоунов, у которых основной рабочей версией была «да OpenAI всё врут и фейкуют, это маркетинг», сегодня будет грустный день. Хотя ладно, таких не проймешь 👨‍🦳
  • 🤔 1
More from @veryvibecoding
  1. Sep 24, 2026С одной стороны, ChatGPT - нормальные модели, и Codex - тоже нормальный продукт, в целом н…
  2. Sep 23, 2026Gemini 3.8 text-to-speech - кому нужна озвучка, может быть интересно https://blog.google/i…
  3. Sep 23, 2026есть все-таки проблемка у GPT. на высоких усилиях модель уж очень долго думает. Дорисовыва…
  4. Sep 23, 2026хахаха Вот это отличная тема. И ведь работает же
  5. Sep 23, 2026Если вы наслаждаетесь новым Opus и вас еще не забанили (пока), рекомендую обратить внимани…
  6. Sep 23, 2026Qwen-Image-2.1 - лучшая опенсорсная модель для рисования картинок, и под нее уже готовы кв…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →