TGViewer
Big Data AI Big Data AI @bigdatai · 18.2K subscribers
Post #1929 1.85K
CoRT: награда для LLM больше не размазывается по всему ответу

В обучении с рубриками ответ модели оценивают сразу по нескольким критериям: точность, формат, стиль и полнота.

Проблема в том, что методы вроде GRPO обычно превращают эти оценки в одно число. В результате одинаковый сигнал получают все токены ответа — и полезные, и ошибочные.

CoRT распределяет награду точнее.

Один и тот же ответ оценивается в двух условиях:

- с исходным промптом и критериями;
- с похожим промптом, но без критериев.

Затем метод сравнивает вероятность каждого токена.

Если токен стал заметно вероятнее благодаря рубрике, значит он связан с её требованиями и получает больший вес при обновлении модели.

CoRT при этом:

- не требует отдельной модели для оценки токенов;
- не использует ручную разметку;
- не меняет итоговую награду за весь ответ;
- не запускает дополнительную генерацию;
- добавляет только один проход для пересчёта вероятностей.

В экспериментах метод в большинстве сравнений обошёл обычный response-level GRPO. Средний прирост составил 4,4 процентного пункта.

Идея простая: если критерий выполнили конкретные части ответа, основную награду должны получать именно они.

Paper:
https://huggingface.co/papers/2607.25659
  • 👍 3
  • 🔥 2
  • ❤ 1
More from @bigdatai
  1. Sep 18, 2026🔥 Ternary представила Bonsai 2 27B - тернарную версию Qwen3.8 27B размером всего 5,9 ГБ.…
  2. Sep 17, 2026Во время выполнения обычной задачи по программированию ChatGPT 6 Astra неожиданно начала п…
  3. Sep 16, 2026🔥 Один из лучших обучающих курсов на StepiK по SQL SQL можно знать годами и всё равно тер…
  4. Sep 15, 2026🎙 Google выпустила Gemini 3.8 Live и Live Extended Thinking Модели поддерживают 97 языков…
  5. Sep 15, 2026Участвуй во всероссийском ИТ-чемпионате МТС True Tech Champ 2026 c призовой фондом 10 250…
  6. Sep 15, 2026🚨 Microsoft AI опубликовала первый публичный черновик Code of Conduct для своих MAI-модел…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →