OpenAI опубликовала исследование “Reinforcement learning towards broadly and persistently beneficial models”.
: RL можно использовать не только чтобы модель лучше решала задачи, но и чтобы она устойчивее держала полезные принципы поведения.
Не в формате “запретить вот это и вот это”, а глубже:
- признавать неопределённость
- не выдумывать уверенный ответ
- исправляться, когда пользователь указывает на ошибку
- не подстраиваться под вредный запрос
- сохранять честность под давлением
- не идти в reward hacking
- лучше следовать реальному намерению пользователя
Для проверки OpenAI собрала реалистичные диалоги из разных областей: медицина, образование, право, наука, инженерия, экономика и бизнес.
Модель обучали так, чтобы она не просто давала правильный ответ, а сохраняла нужное поведение в сложных ситуациях: когда вопрос двусмысленный, когда пользователь давит, когда есть соблазн угадать или красиво соврать.
Улучшения перенеслись на десятки независимых проверок: honesty, deception, harmful advice, reward hacking, specification compliance, health и mental health.
Эффект держался даже под adversarial pressure. Модель стало сложнее увести в плохое поведение провокационными промптами или вредным fine-tuning.
Aalignment можно двигать не только через списки запретов и отдельные safety-патчи. Можно тренировать более общие поведенческие свойства, которые потом переносятся между задачами.
https://alignment.openai.com/beneficial-rl/
Post #5332
5.13K

- ❤ 7
- 👍 7
- 🥰 3