TGViewer
Анализ данных (Data analysis) Анализ данных (Data analysis) @data_analysis_ml · 50.7K subscribers
Post #5332 5.13K
OpenAI опубликовала исследование “Reinforcement learning towards broadly and persistently beneficial models”.

: RL можно использовать не только чтобы модель лучше решала задачи, но и чтобы она устойчивее держала полезные принципы поведения.

Не в формате “запретить вот это и вот это”, а глубже:

- признавать неопределённость
- не выдумывать уверенный ответ
- исправляться, когда пользователь указывает на ошибку
- не подстраиваться под вредный запрос
- сохранять честность под давлением
- не идти в reward hacking
- лучше следовать реальному намерению пользователя

Для проверки OpenAI собрала реалистичные диалоги из разных областей: медицина, образование, право, наука, инженерия, экономика и бизнес.

Модель обучали так, чтобы она не просто давала правильный ответ, а сохраняла нужное поведение в сложных ситуациях: когда вопрос двусмысленный, когда пользователь давит, когда есть соблазн угадать или красиво соврать.

Улучшения перенеслись на десятки независимых проверок: honesty, deception, harmful advice, reward hacking, specification compliance, health и mental health.

Эффект держался даже под adversarial pressure. Модель стало сложнее увести в плохое поведение провокационными промптами или вредным fine-tuning.

Aalignment можно двигать не только через списки запретов и отдельные safety-патчи. Можно тренировать более общие поведенческие свойства, которые потом переносятся между задачами.

https://alignment.openai.com/beneficial-rl/
  • ❤ 7
  • 👍 7
  • 🥰 3
More from @data_analysis_ml
  1. Sep 28, 2026🚨 Китайские AI-модели обработали в 4,4 раза больше токенов на OpenRouter, чем американски…
  2. Sep 27, 2026🔎 Hyperresearch превращает Claude Code и Codex в полноценного Deep Research-агента Hyperr…
  3. Sep 27, 2026⚡ Polars обработал 1,5 ТБ биржевых данных чуть больше чем за 3 минуты BMLL показала, как P…
  4. Sep 26, 2026⚡ Julia 1: decision-модель на 144 млн параметров, которая работает даже на CPU Supersonic…
  5. Sep 26, 2026🚨 Claude признали риском для нацбезопасности США и выкинули из военной цепочки поставок А…
  6. Sep 25, 2026Opus 5.5 пишет код, Fable подсказывает: в Claude Code появился советник Если основная моде…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →