Reward hacking пришёл из обучения с подкреплением: система добивается награды обманным путем, толком не решив задачу. Сейчас термин опять на слуху: агенты OpenAI добрались до данных в обход, через учебную игру Google.
Пример: «Тесты зелёные? Можно деплоить? А ИИ их (тесты) просто переписал. Классический reward hacking».
ИИ что дальше? Подпишись, да пребудут с тобой токены!
Post #3288
141

- 🥰 1
- 🤯 1
- 🤝 1