TGViewer
Все о блокчейн/мозге/space/WEB 3.0 в России и мире Все о блокчейн/мозге/space/WEB 3.0 в России и мире @blockchainrf · 20.5K subscribers
Post #12836 2.76K
Русскоязычная команда с помощью Claude Code автоматизировала открытия новых джейлбрейк атак на LLM

Это один из похожих примеров в стиле кейса Андрея Карпатый.

Исследователи из Max Planck Institute и Imperial College запустили Claude Code в режиме автономного исследования, и он самостоятельно придумал алгоритмы атак на языковые модели, которые обходят все 30+ существующих методов.

И что интересно, он не придумал ничего принципиально нового. Просто брал идеи из существующих методов, скрещивал их между собой, крутил параметры. Такой очень быстрый и дотошный исследователь.

Но результат в 4 раза лучше всего существующего.

Раньше разработка новых атак на LLM занимала у людей месяцы. Claudini сделал это за 1 автономный прогон. И порог входа резко упал, теперь не нужна команда исследователей, нужен агент и GPU.

Авторы говорят, что это нижняя граница того, на что способны агенты сейчас. Верхняя пока неизвестна.​​​​​​​​​​​​​​​​

И это ставит неудобный вопрос: если безопасность моделей можно взламывать автоматически, насколько вообще надёжны существующие защиты?​​​​​​​​​​​​​​​​

GitHub.
  • 👍 10
  • ❤ 6
  • 🤔 4
  • 💯 2
More from @blockchainrf
  1. Sep 25, 2026Свежее от #DeepSeek:они показали,как выглядит фабрика обучения ИИ-агентов изнутри Команда…
  2. Sep 25, 2026Но всех рвет Джефф Дин, ex-Google, его стартап инвесторы оценивают в $50млрд, и это не пре…
  3. Sep 25, 2026Это какое-то безумие, инвесторы оценивают разработчика Jev в $10млрд Мы недавно писали про…
  4. Sep 25, 2026Anthropic разобрали как создать ИИ-агентов для торговли и сами рынки для агентов Команда р…
  5. Sep 24, 2026Google DeepMind говорят, что безусловного дохода недостаточно для счастливого будущего с И…
  6. Sep 24, 2026Шмидхубер стал Chief Scientific Advisor в Sakana AI 🙂
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →