Агента научили получать оценку за каждый шаг без правильного ответа 🫤
IBM Research и CMU представили DRACO — способ обучать агентов на длинных задачах, для которых невозможно написать точный тест результата.
Обычно вся траектория получает одну итоговую награду. После десятков действий модели непонятно, какой именно шаг был полезным, а какой всё сломал.
DRACO делает иначе:
🔘 модель-судья создаёт критерии под конкретную задачу и траекторию;
🔘 оценивает результат по каждому критерию;
🔘 отмечает связанные с ним шаги;
🔘 распределяет награду между этими шагами перед обновлением модели.
На AppWorld модель Qwen3.6-27B улучшила выполнение целей с 69,4% до 85,3%. Результат оказался на 5,3 пункта выше обычного GRPO, обученного на настоящих модульных тестах.
Для тебя это возможность обучать агентов на поддержке, аналитике и сложных рабочих процессах, где нет единственного проверяемого ответа, но можно описать признаки хорошей работы.
Главное ограничение: судья здесь фактически сам определяет цель обучения. Авторы использовали преимущественно одну модель-судью и пока не проверили её критерии на согласие с оценками людей.
Пруфы:
🔘исследование DRACO от 3 сентября 2026 года
🔘код IBM Research
#aiagents #reinforcementlearning #creditassignment #llmtraining #appworld #ibmresearch
@data_engi
Post #1329
155