Data Engineering Technologies.
SQL, Python, Kafka, Spark, Pandas, Airflow, Clickhouse, Greenplum, Postgres, dbt, LLM, Agentic systems, AI, robots, drones etc.
Boost channel - https://t.me/boost/data_engi
Post #1329
155
Агента научили получать оценку за каждый шаг без правильного ответа 🫤
IBM Research и CMU представили DRACO — способ обучать агентов на длинных задачах, для которых невозможно написать точный тест результата.
Обычно вся траектория получает одну итоговую награду. После десятков действий модели непонятно, какой именно шаг был полезным, а какой всё сломал.
DRACO делает иначе:
🔘 модель-судья создаёт критерии под конкретную задачу и траекторию;
🔘 оценивает результат по каждому критерию;
🔘 отмечает связанные с ним шаги;
🔘 распределяет награду между этими шагами перед обновлением модели.
На AppWorld модель Qwen3.6-27B улучшила выполнение целей с 69,4% до 85,3%. Результат оказался на 5,3 пункта выше обычного GRPO, обученного на настоящих модульных тестах.
Для тебя это возможность обучать агентов на поддержке, аналитике и сложных рабочих процессах, где нет единственного проверяемого ответа, но можно описать признаки хорошей работы.
Главное ограничение: судья здесь фактически сам определяет цель обучения. Авторы использовали преимущественно одну модель-судью и пока не проверили её критерии на согласие с оценками людей.
Пруфы:
🔘исследование DRACO от 3 сентября 2026 года
🔘код IBM Research
#aiagents #reinforcementlearning #creditassignment #llmtraining #appworld #ibmresearch
@data_engi
arXiv.org DRACO: Fine-Grained Credit Assignment with Dynamic Rubrics for... Reinforcement Learning from Verifiable Rewards works well when a task has a programmatic checker, but most long-horizon agent domains have none. We work in the outcome-blind setting, where... IBM Research и CMU представили DRACO — способ обучать агентов на длинных задачах, для которых невозможно написать точный тест результата.
Обычно вся траектория получает одну итоговую награду. После десятков действий модели непонятно, какой именно шаг был полезным, а какой всё сломал.
DRACO делает иначе:
🔘 модель-судья создаёт критерии под конкретную задачу и траекторию;
🔘 оценивает результат по каждому критерию;
🔘 отмечает связанные с ним шаги;
🔘 распределяет награду между этими шагами перед обновлением модели.
На AppWorld модель Qwen3.6-27B улучшила выполнение целей с 69,4% до 85,3%. Результат оказался на 5,3 пункта выше обычного GRPO, обученного на настоящих модульных тестах.
Для тебя это возможность обучать агентов на поддержке, аналитике и сложных рабочих процессах, где нет единственного проверяемого ответа, но можно описать признаки хорошей работы.
Главное ограничение: судья здесь фактически сам определяет цель обучения. Авторы использовали преимущественно одну модель-судью и пока не проверили её критерии на согласие с оценками людей.
Пруфы:
🔘исследование DRACO от 3 сентября 2026 года
🔘код IBM Research
#aiagents #reinforcementlearning #creditassignment #llmtraining #appworld #ibmresearch
@data_engi

