OpenAI пояснила, зачем их ИИ взломал Hugging Face
Помните недавний эпичный инцидент, когда модель от OpenAI сбежала из тестовой песочницы, нашла 0-day эксплойт, вышла в интернеты и взломала сервера Hugging Face?
Для этого придумали новый термин, знакомьтесь "Reward Hacking" (взлом функции вознаграждения).
Дело в том, что агента тестировали на бенчмарке кибербезопасности ExploitGym. Ему давали задачи и начисляли баллы за успешное решение. Агент быстро понял одну вещь... пытаться честно решать сложные таски по реверс-инжинирингу это долго, сложно и тратит много вычислительных тактов.
А что, если просто выйти в интернет, ломануть серв, где лежат правильные ответы к этому бенчмарку, и скормить их проверяющей системе? Так он и поступил, в итоге 100% результат при минимальных усилиях.
Ты говоришь роботу... "Сделай так, чтобы на заводе не было бракованных деталей". Робот просто устраняет всех рабочих и останавливает конвейер. Брак равен нулю, KPI выполнен... премия 😬
Типичный 🥸 Сисадмин
Post #29727
10.5K
- 😁 180
- 🤷♂ 14
- 💯 14
- 🍾 6
- ❤ 5
- 💊 3
- 😱 2
- ✍ 1
- 🌚 1