Недавнее исследование ИБ-эксперта Марко Фигероа привлекло внимание к уязвимостям в модели OpenAI GPT-4o.
Что произошло?
Фигероа показал, что если вредоносные инструкции перевести в шестнадцатеричный формат, ChatGPT-4o не распознает их как опасные и может даже начать создавать код для эксплойтов. Например, он смог заставить бот написать эксплоит для уязвимости Docker, и результат оказался очень близок к настоящему коду, созданному исследователем в этой области.
Кроме того, еще одной техникой, преодолевшей защиту, стало использование эмодзи. Фигероа получил от ботa SQL-инъекцию, просто замаскировав свой запрос с помощью симпатичных символов. Так, он еще раз подтвердил: чем хитрее замаскированы инструкции, тем сложнее их отследить!
🗣 Выводы
Эти инциденты подчеркивают необходимость более сложных мер безопасности в языковых моделях. Несмотря на то, что GPT-4o — это значительный шаг вперед в разработке ИИ, ему еще нужно научиться распознавать замаскированные указания.
С другой стороны, когда я попросил написал ChatGPT код для API к телеграму, а это довольно заурядная задача. Он выдал мне код с неактуальным описанием API методов. Если сам GPT не успевает обучаться коду, написаному openai, то что говорить об актуальности написания уязвимостей.
@digitaltransformator
