🛡 OpenAI натравила ИИ на GPT-5.6, чтобы найти уязвимости
OpenAI разработала внутреннюю модель GPT-Red, которая специально атакует другие нейросети и ищет способы обойти их защиту.
Главная цель — борьба с prompt injection. При таких атаках вредоносные команды прячут в письмах, сайтах, файлах или ответах подключённых сервисов. ИИ-агент может принять их за настоящие инструкции и раскрыть данные или выполнить опасное действие.
GPT-Red генерирует всё более сложные атаки, а защищаемая модель учится их распознавать. На одном из тестов система успешно взломала GPT-5.1 в 84% случаев, тогда как люди справились только с 13%.
Найденные уязвимости использовали при обучении GPT-5.6 Sol. В результате количество сбоев на сложных тестах сократилось в шесть раз, а успешность прямых атак снизилась до 0,05%.
⚡️ – далее о том, почему OpenAI не планирует открывать доступ к GPT-Red…
Post #8091
816

- ⚡ 9
- 💯 7
- ❤ 6
- 👍 3
- 🔥 3