TGViewer
Data Secrets Data Secrets @data_secrets · 94.3K subscribers
Post #10065 13.4K
Data Secrets Кстати, по итогу этой встречи ИИ-лидеры подписали добровольное соглашение о контроле В нем написано, что они обязуются ввести внутренний контроль, внутреннюю команду надзора, внешние аудиты и независимый наблюдательный совет. Никаких санкций за нарушение…
Anthropic призывают ограничить GLM-5.3

В стартапе протестировали модель на способности в области поиске уязвимостей, и их главный тезис такой: способности к автономной разработке эксплойтов, которые пять месяцев назад были только у Claude Mythos Preview, теперь есть в открытой модели, причем без серьезных ограничений на злоупотребление. "Так делать нельзя, айайай".

— На бенчмарке ExploitBench (эксплуатация известных уязвимостей в V8) GLM-5.3 довела дело до работающего эксплойта в 50 из 410 попыток, а Mythos Preview в 56.

— На внутреннем бенчмарке Anthropic по бинарной эксплуатации результат 4% против 6% у Mythos. Предыдущие модели, вроде Claude Opus 4.6 и GLM-5.2, там не справились ни разу.

— Всего за 8 часов модель нашла в JS-движке популярного браузера неизвестные уязвимости и собрала из них эксплойт для кражи файлов. Это потребовало 20 минут внимания человека + примерно $20 по тарифам API.

При этом исследователи утверждают, что защиты от вредоносных запросов у модели почти нет. Из коробки она формально отказывается от явно вредных запросов, но обойти это просто: Anthropic это удалось в 92% случаев с помощью банальных джейлбрейков, и в 100% случаев после абляции, то есть удаления механизма отказов из весов.

Авторы напрямую не пишут, что подобные модели надо ограничить, но "слегка" намекают, что, по их мнению, правительства должны проводить safety-тесты мощных моделей, а разработчикам стоит уделять больше внимания безопасности. И, естественно, между строк они напоминают, что вот они-то молодцы, и дают доступ к Mythos 5.1 только проверенным специалистам, и вообще Claude умничка и не ведется на злые джейлбрейки злых хакеров 😇

Забавно, кстати, что пост этот Anthropic выложили именно в день, когда в Белом Доме все американские лидеры подписали соглашение о контроле ИИ с Трампом
  • 😁 205
  • 🐳 36
  • ❤ 21
  • 👍 10
  • 🔥 3
  • 💯 3
  • 🗿 3
  • ⚡ 1
  • 🤯 1
  • 🤗 1
More from @data_secrets
  1. Sep 30, 2026Gemini 4 Argon, сводка: — По бенчмам все супермощно, на многих тестах это новая SOTA, вклю…
  2. Sep 30, 2026Что, простите? Google только что вернулся в гонку с новой моделью, которая превосходит Ast…
  3. Sep 30, 2026Каждую осень у бизнеса просыпается спрос на подрядчиков – бухгалтеров, юристов, маркетолог…
  4. Sep 30, 2026DeepSeek вместе с Huawei разрабатывают альтернативу CUDA Компании выложили в опенсорс набо…
  5. Sep 30, 2026Т-Технологии показали на ACM RecSys 2026 три инструмента для рекомендаций, и все они в опе…
  6. Sep 30, 2026После презентации нового агента Dots от OpenAI домен dot.com начал перенаправлять пользова…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →