Вчера OAI опубликовали новый тип prompt injection атаки, которую они обнаружили во время тренировки новой модели.
Идея в том, что модель может отправить текст, который выглядит как совершенно нормальный для людей в виде письма, слак сообщения, инвайта в календаре, но сам этот текст содержит инструкции для модели принимающей стороны. Инструкции заставляют эту модель так же отправит сообщение всем своим контактам, и так далее по принципу распространения компьютерных вирусов.
Эту конкретную уязвимость пофиксили, но идея теперь в трейнинг дате, так что будущие сверхчеловеческие модели могут брать идею на вооружение.
Одна из самых опасных вещей тут в том, что подобная атака заставляет модель создавать фейковые цепочки рассуждений — что было одним из единственных надежных способов найти мисалайнд (непослушные) модели на тестах.
Post #3253
3.87K
