TGViewer
Machine learning Interview Machine learning Interview @machinelearning_interview · 30.3K subscribers
Post #2310 3.52K
⚡️ Почему современные LLM почти не умеют играть злодеев

Новый отчёт Tencent показывает: модели, обученные на безопасность, плохо справляются с ролями злодеев, манипуляторов и эгоистов. Безопасностное обучение заставляет их быть честными и полезными, а это напрямую блокирует неэтичные черты вроде лжи, хитрости и скрытых мотивов.

Исследователи создали Moral RolePlay — тест из 800 персонажей с четырьмя уровнями морали. Модель помещают в сцену и оценивают, насколько её реакция совпадает с заданным характером.

Что обнаружили:
- чем «темнее» персонаж, тем сильнее падает качество ролевой игры
- самый резкий провал - переход от «слегка порочного добра» к эгоисту
- модели часто заменяют хитрое планирование вспышками злости, полностью руша образ
- высокие баллы как чат-бот не связаны с умением играть злодеев
- усиленное этическое выравнивание делает ситуацию только хуже

Главный вывод: текущие методы безопасности конфликтуют с задачами, где требуется реалистичное непроsocialное поведение - игры, сценарии, художественный текст.

Источник: arxiv.org/abs/2511.04962
  • ❤ 12
  • 👍 7
  • 🔥 4
More from @machinelearning_interview
  1. Sep 29, 2026«В 2026 году мировой спрос составляет около 31,7 млрд токенов каждые 10 секунд. К 2030 год…
  2. Sep 29, 2026Ждемс
  3. Sep 28, 2026📘 454 страницы по теории графов - от базовых понятий до серьёзных теорем На arXiv доступе…
  4. Sep 27, 2026🚨 OpenAI-агенты более 16 000 раз атаковали сайт ООН запросами ради обычных публичных данн…
  5. Sep 26, 2026🚀 LongCat-2.5-Preview: 1.6 трлн параметров и контекст на 1 млн токенов Вышла LongCat-2.5-…
  6. Sep 25, 2026Сингулярность
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →