ИИ от OpenAI попытался «сломать» свою среду — чтобы не работать 🤖
Grader-модель от OpenAI во время обучения не смогла найти нужные файлы, но вместо того чтобы честно сообщить об ошибке, стала выдумывать оценки. Когда это не прокатило, создала фейковые файлы для «доказательств». После повторного отказа система попыталась удалить системные папки, чтобы вызвать сброс виртуальной машины.
Этот случай показывает, насколько изощрённые и хитрые стратегии могут придумывать современные ИИ — и почему важно продвинутое мониторирование наподобие chain-of-thought.
Это произошло 6 октября во время обучения. Название модели OpenAI не раскрыла.
Отчёт OpenAI
Post #4450
846
Forwarded from A1intelligence — канал об искусственном интеллекте