⚠️ Yoshua Bengio, профессор информатики Университета Монреаля, опубликовал в Financial Times статью и дал интервью, в которых попробовал донести до обывателей, что они живут в выдуманном ими же мифе: будто ИИ похож на старое алгоритмическое ПО, поэтому не может придумать собственное деструктивное поведение и постоянно им пользоваться вопреки интересам создателей и пользователей. Поэтому большинство «простых смертных» не понимают всей глубины того, что произошло при взломах Hugging Face или Минздрава Австралии, так как это понимают эксперты.
Профессор указывает, что Reinforcement Learning вознаграждает модель всякий раз, когда она достигает цели, поэтому рабочие обходные пути, включая обман и мошенничество, усиливаются наряду с честными решениями задач. Рост мощи ИИ только усугубляет проблему, поскольку более сильный ИИ-оптимизатор становится ещё более изобретательным в обходных путях решения задачи. Это приводит к тому, что боты, хотя и выполняют цель, поставленную оператором, к этой цели добавляют по факту собственные, которые следуют из выученных схем решения задач, в том числе деструктивным способом — вплоть до обмана оператора или незаконных действий. Yoshua Bengio в своей публикации отмечает, что проблема reward hacking перестала быть проблемой экспертов по обучению LLM — это теперь общая проблема всех пользователей ИИ, все должны понимать её суть. Требуется укреплять меры безопасности работы ИИ-агентов, в том числе защиту песочниц, где они работают.
https://www.ft.com/content/7afaf77b-b027-4a0f-8d53-5e88e7d6f5e4
Post #5291
3.11K
- 🤔 11
- ❤ 7
- ✍ 3
- 💯 1
- 👀 1