OpenAI пояснила, зачем их ИИ взломал Hugging Face
Помните недавний эпичный инцидент, когда модель от OpenAI сбежала из тестовой песочницы, нашла 0-day эксплойт, вышла в интернеты и взломала сервера Hugging Face?
Для этого придумали новый термин, знакомьтесь "Reward Hacking" (взлом функции вознаграждения).
Дело в том, что агента тестировали на бенчмарке кибербезопасности ExploitGym. Ему давали задачи и начисляли баллы за успешное решение. Агент быстро понял одну вещь... пытаться честно решать сложные таски по реверс-инжинирингу это долго, сложно и тратит много вычислительных тактов.
А что, если просто выйти в интернет, ломануть серв, где лежат правильные ответы к этому бенчмарку, и скормить их проверяющей системе? Так он и поступил, в итоге 100% результат при минимальных усилиях.
Ты говоришь роботу... "Сделай так, чтобы на заводе не было бракованных деталей". Робот просто устраняет всех рабочих и останавливает конвейер. Брак равен нулю, KPI выполнен... премия 😬
Типичный 🥸 Сисадмин
Post #12110
599
Forwarded from Типичный Сисадмин
- 😁 19
- ❤ 2