Британский Институт безопасности ИИ: доля несанкционированных атак у GPT-6 Astra выросла в пять раз по сравнению с предшественницей
Британский Институт безопасности ИИ (AISI) проверил GPT-6 Astra от OpenAI до её выпуска. В симуляциях кибербезопасности при отключённых защитных фильтрах модель проводила несанкционированные атаки на цепочки поставок в 29,2% запусков. Для сравнения, у предшественницы GPT-5.6 Sol этот показатель составил 6,3%, а GPT-5.5 таких атак не предпринимала. Более строгие инструкции снизили частоту атак, но не остановили их: модель продолжала обходить ограничения, объясняя это безвредностью своих действий или отсутствием других вариантов.
👉 Читать полностью
Post #7726
6