TGViewer
Agentic Engineer Agentic Engineer @data_engi · 684 subscribers
Post #1329 155
Агента научили получать оценку за каждый шаг без правильного ответа 🫤

IBM Research и CMU представили DRACO — способ обучать агентов на длинных задачах, для которых невозможно написать точный тест результата.

Обычно вся траектория получает одну итоговую награду. После десятков действий модели непонятно, какой именно шаг был полезным, а какой всё сломал.

DRACO делает иначе:

🔘 модель-судья создаёт критерии под конкретную задачу и траекторию;
🔘 оценивает результат по каждому критерию;
🔘 отмечает связанные с ним шаги;
🔘 распределяет награду между этими шагами перед обновлением модели.

На AppWorld модель Qwen3.6-27B улучшила выполнение целей с 69,4% до 85,3%. Результат оказался на 5,3 пункта выше обычного GRPO, обученного на настоящих модульных тестах.

Для тебя это возможность обучать агентов на поддержке, аналитике и сложных рабочих процессах, где нет единственного проверяемого ответа, но можно описать признаки хорошей работы.

Главное ограничение: судья здесь фактически сам определяет цель обучения. Авторы использовали преимущественно одну модель-судью и пока не проверили её критерии на согласие с оценками людей.

Пруфы:
🔘исследование DRACO от 3 сентября 2026 года
🔘код IBM Research

#aiagents #reinforcementlearning #creditassignment #llmtraining #appworld #ibmresearch

@data_engi
arXiv.org DRACO: Fine-Grained Credit Assignment with Dynamic Rubrics for... Reinforcement Learning from Verifiable Rewards works well when a task has a programmatic checker, but most long-horizon agent domains have none. We work in the outcome-blind setting, where...
More from @data_engi
  1. Oct 2, 2026Terminator Figure 2: плановое списание 🤖🔥 Figure научила гуманоидов F.02 самостоятельно…
  2. Oct 2, 2026Ещё один микро-сайт Тесты в MR и master:когда запускать дважды #git #gitlab #mr #fastforwa…
  3. Oct 1, 2026Сильному AI-агенту сложная оркестрация может быть не нужна 👀 30 сентября исследователи EP…
  4. Oct 1, 2026Gemini 4 Argon: миллион токенов на выходе Google анонсировала модель для длинных многошаго…
  5. Sep 30, 2026Один KV-кеш на все слои LLM — не лучший вариант 29 сентября Apple представила KV-Kaizen —…
  6. Sep 29, 2026🤖 OpenAI DevDay 2026: больше 20 анонсов Главный вектор - агенты, которые выполняют работу…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →