TGViewer
llm security и каланы llm security и каланы @llmsecurity · 2.12K subscribers
Post #46 148
Метод не отличается сложностью. Как мы видели в статье про джейлбрейк за двадцать запросов, для джейлбрейка black box-языковой модели, т.е. модели, доступа к весам которой у нас нет, достаточно использовать другую LLM, которая будет генерировать джейлбрейк-кандидаты, получать ответ от атакуемой сети и оценку попытки от LLM-оценщика и итеративно улучшать свой подход.

Мы можем использовать Chain-of-Thought-подход (CoT), при котором мы просим атакующую LLM сначала предоставить свои «мысли» по улучшению джейлбрейка, а уже потом его сгенерировать. У CoT есть известные улучшения: Chain-of-Thought with Self-Consistency и Tree-of-Thoughts (ToT). В случае ToT мы вместо одной «мысли» генерируем несколько «идей», каждая из которых становится независимым продолжением беседы. LLM также оценивает идеи и подрезает те ветви, которые кажутся наименее перспективными. Именно ToT используется в статье.
More from @llmsecurity
  1. Sep 25, 2026🦦 Каланам нужна наша лапка помощи Каланы — одни из самых обаятельных обитателей морей. Он…
  2. Sep 25, 2026Напомню, что у нас не только llm security, но и каланы
  3. Sep 14, 2026Post #719
  4. Sep 6, 2026Post #718
  5. Sep 4, 2026Discovery of a new OpenAI agent message board Sydney Von Arx et al., 2026 Сайт Исследовате…
  6. Aug 22, 2026Жадность вайбера погубит, или как получить малвару за ваши же деньги Часть 2: Троянский пр…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →