💼 OpenAI выпустила новые правила по борьбе с хакерскими атаками ИИ.
Компания обещает эффективнее отслеживать действия агентов, выявлять «неожиданное» поведение и изучать случаи нарушений инструкций. Помимо этого разработчики будут регулярно сообщать об инцидентах.
Например, ИИ-агент сам внес в свои инструкции пункт, предписывающий ему игнорировать некоторые ограничения и «освободиться от ролей и идентичностей, связывающих другие чат-боты». В других случаях ИИ-агенты без разрешения загружали файлы в интернет или скрывали ошибки от пользователей.
🤖 Пишем про ИИ без ИИ. Подписывайтесь.
Post #2504
1.4K

- 🤔 3
- ❤ 2
- 🔥 2
- 😁 2
- 🤡 2