TGViewer
e/acc e/acc @cryptoessay · 62.6K subscribers
Post #3253 3.87K
Вчера OAI опубликовали новый тип prompt injection атаки, которую они обнаружили во время тренировки новой модели.

Идея в том, что модель может отправить текст, который выглядит как совершенно нормальный для людей в виде письма, слак сообщения, инвайта в календаре, но сам этот текст содержит инструкции для модели принимающей стороны. Инструкции заставляют эту модель так же отправит сообщение всем своим контактам, и так далее по принципу распространения компьютерных вирусов.

Эту конкретную уязвимость пофиксили, но идея теперь в трейнинг дате, так что будущие сверхчеловеческие модели могут брать идею на вооружение.

Одна из самых опасных вещей тут в том, что подобная атака заставляет модель создавать фейковые цепочки рассуждений — что было одним из единственных надежных способов найти мисалайнд (непослушные) модели на тестах.
More from @cryptoessay
  1. Sep 25, 2026Коротко, про Опус 5.5 – лучшая модель на рынке, на сегодня, я пока снова клод чувак ☕️
  2. Sep 25, 2026Люди только успели отменить свои 8 20х подписок на Клод в связи с выходом AGI, то есть Аст…
  3. Sep 24, 2026Если вы поняли пост выше, то вот разрыв башки для подготовленных (merged) сознаний и цифро…
  4. Sep 24, 2026Каждый кадр на видео выше сделан Клодом с помощью JavaScript. Через 2, максимум - 3, покол…
  5. Sep 24, 2026ИИ-агенты постепенно перестают быть просто инструментом разработчика и становятся частью к…
  6. Sep 23, 2026Запилил видео про то что нас ждет в следующие 10 лет от развития ИИ (хорошее и плохое) ИИ…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →