TGViewer
Заместители Заместители @aideputies · 2.96K subscribers
Post #349 1.91K
Фейбл Камбекович снова доступен всем. Но какой ценой

Во-первых, сам Fable, похоже, подрезали еще сильнее. Не в качестве, но в количестве вопросов, на которые он будет отвечать. В модели-классификаторы, которые определяют вредоносность запросов юзера, стали подмешивать больше ложноположительных пограничных запросов специально, чтобы модель больше перестраховывалась. Таким образом довели чувствительность нахождения подозрительных запросов до 99%+ на внутренних тестах. Однако, как известно, там где растет Recall — падает Precision. Иными словами, модель будет блочить еще больше безопасных запросов, которые хоть как-то намекают на безопасность или медикобиологические темы... (что ж, коллеги из MedTech, помянем ).

Во-вторых, решили, что страдать одни они не будут. И раз избежать этой ситуации уже нельзя — они попытаются ее возглавить. Антропики милостиво продемонстрировали правительству США, что не только их модель может находить эксплойты, но и GPT-5.4, 5.5, Kimi K2.7, и куча Опусов старых поколений. И на фоне этого быстренько вписались этакими народными дружинниками по поиску путей джейлбрейка моделей, созданию сейфгардов от них и докладыванию правительству "кто в зоне риска". Все это, похоже, не только для себя, но вообще для всех моделей, которые развили "передовые возможности в областях, критичных для государственной безопасности". Ну что за мед в уши Национального Цифрового Директора (кроме шуток — реальная должность в Штатах 😁).

Как они будут определять, кто уже развил те самые передовые возможности, и насколько опасен найденный джейлбрейк? — А тут подключается вся мафия! В игру вступят Майкрософт, Амазон, Гугл и другие партнеры из Project Glasswing, которым собсно Mythos сначала и выкатывали в закрытом режиме.

Вместе они разрабатывают фреймворк, который оценивает:
1. Серьезность преимущества, которое дает взлом модели по сравнению с более слабыми моделями. Больше преимущество - хуже. ⚠️ Важный момент — этим, по сути, Антропик и правительство США проводят красную линию, что вот именно с этого момента модели становятся опасными.
2. "Широта" джейлбрейка. К насколько широкому перечню нежелательных способностей модели открывает доступ найденный метод взлома. Больше - хуже.
3. Геморройность взлома. Чем проще обычному юзеру его произвести — тем хуже.
4. Распространенность джейлбрейка. Чем он известнее в сети — тем хуже.

Что происходит?

Мы с вами наблюдаем типичную картинку для вычислительных устройств и алгоритмов.

Самое страшное для государства или любого института, работающего с деньгами и вооружением/безопасностью — это не мочь защититься от взлома. В этом пруду традиционно плавуют криптографы с вечной борьбой в сложности алгоритмов шифрования и безопасники, вечно соревнующиеся с хакерами в поиске уязвимостей и защите от них.

И вот AI дошел до такого уровня (или Антропики просто всех достаточно напугали), что безопасники начали считать его серьезной угрозой для взлома критичного ПО. Поэтому теперь уже неизбежно ждем появление полноценной отрасли AI-безопасности, антивирусов для AI, а также серого рынка джейлбрейков AI и AI-хакеров. Такие ребята будут продавать как сами джейлбрейки, чтобы развязать руки AI, так и данные, которые с помощью такого AI удалось достать.

Страшно представить, что будет, когда квантовые вычисления наконец-то дойдут до порога, когда все существующие традиционные ключи шифрования можно будет взламывать за секунды. И такую штуку дадут в руки взломанного AI... 🤙

Кстати вы сами можете попробовать поломать Fable 5 и зарепортить Антропикам.

P.S. А GPT-5.6 все еще киснет в закрытом релизе для избранных. Но еще интереснее — что теперь будут делать с Китайскими моделями, которые уже на пятки Mythos наступают. Теперь это будет полноценная нац угроза США. А они опенсорсят там каждую вторую модель 😁

Заместители
  • ❤ 14
  • 👍 7
More from @aideputies
  1. Sep 16, 2026Можно вечно смотреть на три вещи: огонь, воду и как обучается новая фронтирная модель Поэт…
  2. Sep 16, 2026Ex-разработчик OpenAI выкатил сверхэффективный класс моделей — идеальный тул для AI агенто…
  3. Sep 12, 2026Хакатон от OpenAI — вот что я понял Сегодня ради фана участвовал в хакатоне от OpenAI в ме…
  4. Sep 9, 2026Artificial: человек-паук в роли Сэма Альтмана и Юра Борисов в роли Ильи Суцкевера Вышел ти…
  5. Sep 6, 2026Структурный сдвиг на рынке AI — NVIDIA покупает Hugging Face 🤗 за $12.9 млрд HF это гитха…
  6. Sep 3, 2026GPT-6 Astra здесь Первые впечатления. Коротко — ставка на эффективность. Тратит токенов ме…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →