TGViewer
Гостев из будущего Гостев из будущего @gostev_future · 1.41K subscribers
Post #348 4.36K
Исследователи обнаружили любопытную деталь в новой кампании Mini Shai-Hulud, Miasma и Hades. Авторы вредоносного кода начали добавлять в свои пакеты текстовые блоки про биологическое и ядерное оружие. Не потому, что они внезапно заинтересовались массовым поражением человечества.

Цель намного современнее.

Если файл попадёт на анализ к системе, использующей LLM, есть шанс, что модель увидит чувствительный контент, решит, что перед ней опасный запрос, и откажется проводить анализ. Проще говоря, вредоносная программа пыталась спрятаться за собственным safety-фильтром искусственного интеллекта.

Десятилетиями вредоносный код писался для компьютеров и маскировался от компьютеров. Потом появились методы, рассчитанные на обман исследователей. Теперь появился новый класс техник, рассчитанных на обман ИИ.

Фактически мы наблюдаем первые признаки того, что злоумышленники начали воспринимать большие языковые модели как полноценную часть защитной инфраструктуры. Если раньше нужно было обходить сигнатуры антивируса или эвристики песочницы, то теперь появляется ещё одна поверхность атаки — поведение модели.

Последние несколько лет крупнейшие разработчики моделей соревновались в том, кто лучше научит ИИ отказываться отвечать на опасные запросы. Но любой механизм отказа можно превратить в механизм уклонения. Если защитная система автоматически отдаёт подозрительный файл модели на анализ, злоумышленник рано или поздно попробует заставить эту модель замолчать.

Собственно, это и произошло.

Нельзя просто взять LLM, поставить её в центр процесса анализа и надеяться, что всё будет хорошо. Потому что как только модель становится частью защитного контура, она автоматически становится целью атакующих.

Мы только начинаем видеть первые эксперименты в этом направлении.

@gostev_future
  • 🔥 9
  • 👍 8
  • ❤‍🔥 1
  • 👏 1
  • 😱 1
  • 🎃 1
More from @gostev_future
  1. Sep 23, 2026На прошлой неделе обнаружилась биолаборатория Anthropic, на этой неделе у лаборатории уже…
  2. Sep 22, 2026Помните исследование о том, как ИИ играет в Civilization? А вот мой однофамилец Питер Гост…
  3. Sep 20, 2026Я уже писал о недавнем аресте австралийца Рубена Томсона из TeamPCP, который, при всех сво…
  4. Sep 20, 2026У президента с высочайшим IQ есть любимое занятие — что-нибудь переименовать. Мексиканский…
  5. Sep 19, 2026Сегодня в России проходят выборы, и в этой связи для цикла «Гостев из прошлого» у меня тож…
  6. Sep 18, 2026На этой неделе много обсуждали, как руководители крупнейших американских ИИ-лабораторий вд…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →