Post #99
211
В целом, статья достаточно интересная, пусть и фокусируется на одной конкретной атаке. Во-первых, в ней вообще очень неплохой обзор истории adversarial examples и защит от них, в том числе в NLP, во-вторых, в ней делается достаточно оригинальное заявление, что ограничением на атаку является не l_p-норма (как сильно мы поменяли картинку), а то, сколько вычислений атакующему придется потратить на выполнение задуманного. Жаль, что основным фокусом является именно alignment и джейлбрейки, а не prompt injection'ы, которые в перспективе являются более неприятной проблемой.
Simon Willison’s Weblog Prompt injection and jailbreaking are not the same thing I keep seeing people use the term “prompt injection” when they’re actually talking about “jailbreaking”. This mistake is so common now that I’m not sure it’s possible to correct course: …