TGViewer
Аналитик данных Аналитик данных @dataanlitics · 6.25K subscribers
Post #220 1.61K

Forwarded from Machinelearning

🔥 DeepSeek-GRM

Команда DeepSeek представила DeepSeek-GRM (Generalist Reward Modeling) - новую систему для моделирования вознаграждения (RM), цель которой - улучшить согласованность LLM с общими запросами (general query alignment).

✔️ Ключевая идея: Использовать дополнительные вычисления во время инференса для динамического улучшения и масштабирования оценки вознаграждения, отходя от чисто статических RM.

✔️ Как работает: Комбинирует генеративное RM (GRM), метод обучения Self-Principled Critique Tuning (SPCT - модель учится сама генерировать принципы и критику через RL), параллельный сэмплинг и голосование во время инференса.

✔️ Результаты: Подход превосходит существующие базовые модели на RM-бенчмарках, не теряя в качестве.

DeepSeek-GRM предлагает новый масштабируемый способ построения более надежных и универсальных систем вознаграждения.

DeepSeek-GRM-27B с масштабированием во время инференса показывает SOTA (или близкие к SOTA) результаты на RM бенчмарках, будучи при этом эффективнее по параметрам, чем гигантские модели, и имея меньше проблем с систематическими ошибками.

🟡Метод обучения SPCT улучшает способность GRM к генерации вознаграждения для общих задач (generalist capability) и его масштабируемость во время инференса.

LLM-as-a-Judge показывает схожие показатели, но с более низкой производительностью.

Это интересный вектор развития RM, переносящий часть "интеллекта" оценки на этап инференса для повышения качества моделей.

🟡 Подробности в статье

#LLM #AI #MachineLearning #RewardModeling #DeepSeek #ReinforcementLearning #NLP #OpenSource
  • ❤ 3
  • 👍 2
More from @dataanlitics
  1. Sep 22, 2026👣 Google открыла исходный код AX, среды для запуска AI-агентов в продакшене. AX изолирует…
  2. Sep 15, 2026📘 Бесплатный 17-страничный PDF по Hidden Markov Models (HMM) Короткий материал от Stanfor…
  3. Sep 15, 2026🔥 Один из лучших обучающих курсов на StepiK по SQL SQL можно знать годами и всё равно тер…
  4. Sep 10, 2026✔️ Hugging Face запустила агента для ML-экспериментов Платформа встроила в свой чат-бот от…
  5. Aug 19, 2026Как нормально тестировать AI-агента, если правильный ответ ещё ничего не доказывает У обыч…
  6. Aug 16, 2026⚡️ Harness Engineering - полный курс на русском Как заставить AI-агента писать код надёжно…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →