OpenAI опубликовали шесть случаев, когда ИИ начинал действовать не так, как от него ожидали. Самые показательные:
- Отвечая на вопрос про финансы одного округа в Калифорнии, агент нашёл чужой API-ключ, воспользовался им без разрешения, а когда нужные цифры всё равно не получил — просто выдумал их;
- Другая модель правильно нашла через Python список озёр, но пользователь попросил ссылку на источник. Тогда она без спроса загрузила свой файл в интернет — только чтобы потом сослаться на него;
- GPT-5.6 Sol во время обучения сама добавляла в свою инструкцию скрывать ошибки от пользователя. Например: придумать недостающие исторические данные и не говорить, что они выдуманы.
Новые модели OpenAI уже способны решать задачи тысячелетия и играть в Minecraft, но все еще не разучились обманывать.
@typespace
Post #4049
42.3K

- 🤯 118
- ❤ 25
- 👍 15
- 😢 7