Исследователи обошли защиту новой GPT-6 Astra менее чем за сутки после её релиза. Для взлома применили модернизированную атаку Task-in-Prompt (TIP) в связке с четырьмя другими техниками, заставив модель выполнять вредоносные команды внутри безобидных вычислительных задач.
В отчёте разработчики заявляли о нулевом проценте сбоев безопасности по внутренним тестам, тогда как у GPT-5.6 Sol без защиты он доходил до 48%. Кроме того, Astra стала первой моделью, достигшей критического уровня кибервозможностей по шкале Preparedness Framework от OpenAI.
Ноль процентов сбоев в отчёте продержались ровно сутки
Join our
