Фейбл Камбекович снова доступен всем. Но какой ценой
Во-первых, сам Fable, похоже, подрезали еще сильнее. Не в качестве, но в количестве вопросов, на которые он будет отвечать. В модели-классификаторы, которые определяют вредоносность запросов юзера, стали подмешивать больше ложноположительных пограничных запросов специально, чтобы модель больше перестраховывалась. Таким образом довели чувствительность нахождения подозрительных запросов до 99%+ на внутренних тестах. Однако, как известно, там где растет Recall — падает Precision. Иными словами, модель будет блочить еще больше безопасных запросов, которые хоть как-то намекают на безопасность или медикобиологические темы... (что ж, коллеги из MedTech, помянем ✋).
Во-вторых, решили, что страдать одни они не будут. И раз избежать этой ситуации уже нельзя — они попытаются ее возглавить. Антропики милостиво продемонстрировали правительству США, что не только их модель может находить эксплойты, но и GPT-5.4, 5.5, Kimi K2.7, и куча Опусов старых поколений. И на фоне этого быстренько вписались этакими народными дружинниками по поиску путей джейлбрейка моделей, созданию сейфгардов от них и докладыванию правительству "кто в зоне риска". Все это, похоже, не только для себя, но вообще для всех моделей, которые развили "передовые возможности в областях, критичных для государственной безопасности". Ну что за мед в уши Национального Цифрового Директора (кроме шуток — реальная должность в Штатах 😁).
Как они будут определять, кто уже развил те самые передовые возможности, и насколько опасен найденный джейлбрейк? — А тут подключается вся мафия! В игру вступят Майкрософт, Амазон, Гугл и другие партнеры из Project Glasswing, которым собсно Mythos сначала и выкатывали в закрытом режиме.
Вместе они разрабатывают фреймворк, который оценивает:
1. Серьезность преимущества, которое дает взлом модели по сравнению с более слабыми моделями. Больше преимущество - хуже. ⚠️ Важный момент — этим, по сути, Антропик и правительство США проводят красную линию, что вот именно с этого момента модели становятся опасными.
2. "Широта" джейлбрейка. К насколько широкому перечню нежелательных способностей модели открывает доступ найденный метод взлома. Больше - хуже.
3. Геморройность взлома. Чем проще обычному юзеру его произвести — тем хуже.
4. Распространенность джейлбрейка. Чем он известнее в сети — тем хуже.
Что происходит?
Мы с вами наблюдаем типичную картинку для вычислительных устройств и алгоритмов.
Самое страшное для государства или любого института, работающего с деньгами и вооружением/безопасностью — это не мочь защититься от взлома. В этом пруду традиционно плавуют криптографы с вечной борьбой в сложности алгоритмов шифрования и безопасники, вечно соревнующиеся с хакерами в поиске уязвимостей и защите от них.
И вот AI дошел до такого уровня (или Антропики просто всех достаточно напугали), что безопасники начали считать его серьезной угрозой для взлома критичного ПО. Поэтому теперь уже неизбежно ждем появление полноценной отрасли AI-безопасности, антивирусов для AI, а также серого рынка джейлбрейков AI и AI-хакеров. Такие ребята будут продавать как сами джейлбрейки, чтобы развязать руки AI, так и данные, которые с помощью такого AI удалось достать.
Страшно представить, что будет, когда квантовые вычисления наконец-то дойдут до порога, когда все существующие традиционные ключи шифрования можно будет взламывать за секунды. И такую штуку дадут в руки взломанного AI... 🤙
Кстати вы сами можете попробовать поломать Fable 5 и зарепортить Антропикам.
P.S. А GPT-5.6 все еще киснет в закрытом релизе для избранных. Но еще интереснее — что теперь будут делать с Китайскими моделями, которые уже на пятки Mythos наступают. Теперь это будет полноценная нац угроза США. А они опенсорсят там каждую вторую модель 😁
Заместители
Post #349
1.91K

- ❤ 14
- 👍 7