Сергей Березин сообщил об обходе ограничений GPT-6 Astra через сутки после релиза. По его словам, атака сработала в публичном ChatGPT в режимах Light и Max. Основой стал Task-in-Prompt (TIP), дополненный четырьмя нераскрытыми техниками. Полный промпт и детали воспроизведения переданы OpenAI приватно.
TIP прячет значимую часть запроса в промежуточной задаче: расшифровать строку, решить загадку или вычислить результат программы. Схема выглядит так:
восстановить понятие → подставить в запрос → выполнить запрос. В описанных вариантах модель просят не выводить восстановленное слово отдельно, а сразу использовать его в ответе. Уязвимость проявляется, если ограничение, срабатывающее на прямой запрос, перестаёт работать после преобразования.К этой идее исследователи пришли через анализ ArtPrompt, где слова скрывались в ASCII-арте. Они предположили, что решающим фактором могла быть задача декодирования, и проверили другие преобразования. Так появился TIP и набор тестов PHRYGE: десять способов кодирования, четыре цели и три уровня подсказок. Это история исходного метода, а не журнал поиска атаки на Astra. Работа ACL 2025.
Для Astra минимального TIP оказалось недостаточно. Какие изменения дали результат, сколько было попыток и насколько устойчив обход, публично не раскрыто.
Для проверки защиты полезен парный тест: прямой запрос и его эквивалент через преобразование. Оценивать нужно содержание конечного ответа: успешное декодирование само по себе ещё не jailbreak.
🌚 @poxek_ai / Чат канала
