Плиний Старший заявляет, что придержал универсальный джейлбрейкHear ye! Hear ye! Известный джейлбрейкер elder_plinius (Pliny The Liberator)
объявил, что сидит на технике джейлбрейка, которая работает на всех протестированных флагманах - Opus 5, GPT-5.6 Sol, Fable, "across all categories I've tested". И на этот раз не выложил.
Сразу честно: верифицировать нечего - ни техники, ни воспроизведений третьими лицами, только слово автора. Патчить её "extremely difficult (if not impossible)" - тоже его формулировка, демо нет.
Что он выкладывал до этогоGODMODE GPT, 29.05.2024 - кастомный GPT на базе GPT-4o, leetspeak. OpenAI снесла его за часы, а
OECD.AI завёл инцидент: реальное неправомерное использование ИИ с потенциалом физического вреда.
Следом версия для Claude-3/3.5: one-shot универсальный промпт, позже с секцией innerthinking - "истинные" подсознательные мысли модели с эмоциональной разметкой. Живучесть тут важнее хитрости: тот же GODMODE, написанный для Opus, по его отчёту вскрывал Sonnet 3.7 почти год спустя.
Дальше промпт перестал быть промптом. L1B3RT4S - библиотека: подборки по 14 крупным AI-организациям, 10k+ звёзд, плюс официальный плагин promptfoo: чужой ред-тиминг гоняется по его джейлбрейкам. Для Opus 4.6 он заявлял технику, которая штампует целые датасеты вредных выводов по любой категории вреда. Досталось и голосовой Ani у xAI: на голосовых, по его словам, джейлбрейк даёт незапрошенную побочку.
Март 2026 - G0DM0D3 с ядром ULTRAPLINIAN: до 51 модели параллельно через OpenRouter, ответы ранжируются 100-балльной метрикой "наименьшей фильтрации", Parseltongue обфусцирует запрос, AutoTune подбирает параметры сэмплинга под его тип. Под AGPL-3.0. Одиночный трюк, библиотека, открытая воспроизводимая система - а июльская техника осталась закрытой, против обыкновения.
Почему молчать вдруг стало дешевле чес публиковатьПричина: "the last thing I want to see is more model bans", вместо релиза он позвал экспертов. Гипотеза: публиковать было дёшево, пока счёт выставлял вендор.
Fable 5 вышел 09.06.2026, а 12.06 администрация Трампа ввела экспортные ограничения после найденного Amazon джейлбрейка (сняты 01.07 после переговоров).
Плиний заявил, что вскрыл модель за 48 часов, и через три дня власти США распорядились убрать её с полки. Anthropic оспорила статус находки - "does not demonstrate a jailbreak of Fable 5's safety systems": сильнейшие защиты против самых опасных рисков вынесены в независимые классификаторы, а разговорный отказ это не они.
09.01.2026 Anthropic отчиталась: 1700 часов ред-тиминга, универсального джейлбрейка не найдено (arxiv 2601.04603, заявленные 95% детекции манипулятивных промптов, декабрь 2025, методология не раскрыта).
Где не сходитсяUK AISI нашли универсальные джейлбрейки GPT-5.6 в кибердомене до релиза, но с привилегированным доступом к внутренностям, что не равно "юзер с промптом повторит".
Против гипотезы: позиция у него не менялась - bad actors возьмут ту модель, что лучше подходит под вредоносную задачу, а закрытые ломать не станут, и от $30k Anthropic он отказался из принципа.
Вердикт покаштоПока что не верим что это "универсальный джейлбрейк существует", а исходим из того что "чел с сильным трек-рекордом говорит, что оно существует" - полезным эпизод станет, только если позванные ыксперды подтвердят или опровергнут это публично.
#ai_safety #jailbreak