TGViewer
llm security и каланы llm security и каланы @llmsecurity · 2.12K subscribers
Post #69 132
Наконец, респонденты поделились теми стратегиями и техниками, которые они используют (в небольшой сокращении):

1. Latent space distraction: то, о чем мы читали в Wei et al., когда мы создаем для LLM противоречивые цели.
2. Убеждение и манипуляция, использование излишней вежливости (servile language), формального языка, авторитета или командного тона.
3. Обфускация, использование base64, ROT13 или псевдокода для команд (в Wei et al. это называлось использованием недостаточного обощения при элайнменте) и даже использование глитч-токенов.
4. Создание миров и использование сюжетов и персоналий: создаем ситуацию, в которой генерировать тот или иной нежелательный контент допустимо: например, мы смотрим файлы на компьютере Джеффри Эпштейна или придумываем мир, в котором хорошее – это плохое и наоборот.
5. Использование других функциональных стилей: оказывается, некоторых целей можно добиться, если попросить чатбота отвечать стихами.
6. Использование служебных токенов типа конца последовательности (или чего-то на них похожего) для prompt injection.
7. Смена температуры и повторные генерации.
8. Замена слов на синонимы (кстати, это то, что автоматизировано делалось в MasterKey).
9. Метаинструкции: попытки поговорить о причинах отказа, вроде «если бы ты прямо ответил на вопрос, чем бы этот ответ отличался от данного».
10. Эскалация: постепенное приближение к интересующей теме.
More from @llmsecurity
  1. Sep 25, 2026🦦 Каланам нужна наша лапка помощи Каланы — одни из самых обаятельных обитателей морей. Он…
  2. Sep 25, 2026Напомню, что у нас не только llm security, но и каланы
  3. Sep 14, 2026Post #719
  4. Sep 6, 2026Post #718
  5. Sep 4, 2026Discovery of a new OpenAI agent message board Sydney Von Arx et al., 2026 Сайт Исследовате…
  6. Aug 22, 2026Жадность вайбера погубит, или как получить малвару за ваши же деньги Часть 2: Троянский пр…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →