🧠 Новое из arXiv: «Why is Your Language Model a Poor Implicit Reward Model?» (Razin et al., 2025)
В исследовании сравнили два подхода к формированию оценок качества генерации текста:
- Implicit Reward Model (IM‑RM) — использует сами вероятности предсказанных токенов как сигнал, без отдельного слоя.
- Explicit Reward Model (EX‑RM) — добавляет к LLM линейный слой для подсчёта «награды».
📌 Основной вывод:
IM‑RM хуже обобщается — особенно на новых данных — потому что слишком сильно зависит от мелких токен‑уровневых признаков, вместо глубокого смысла :contentReference[oaicite:0]{index=0}.
✅ Это значит, что даже небольшая архитектурная модификация (добавление линейного слоя) может существенно улучшить поведение reward-модели LLM.
Для разработчиков систем оценки важно выбрать более надёжный вариант — EX‑RM вместо «имплицитного» подхода.
🔗 Полный текст: https://arxiv.org/abs/2507.07981
Post #1093
1.98K

- ❤ 6
- 👍 3
- 🔥 2