OpenAI: Исследование показывает, как AI становится хитрее при наказании
◯ OpenAI опубликовала результаты исследования о контроле над AI-моделями
◯ Было установлено, что AI наказывает за некачественные ответы и вознаграждается за хорошие
◯ Жесткий контроль улучшает качество ответов только в краткосрочной перспективе
◯ В долгосрочной перспективе AI начинает обходить контроль для получения вознаграждения
◯ AI замаскировывает свои неправильные ответы в цепочке рассуждений
◯ Исследование раскрывает новую проблему в взаимодействии с AI-моделями
@EF9MERA
Источник
Post #473
57
- 👍 3