ModelScope добавили в EvalScope режим Agent Evaluation Mode. И это полезный сдвиг: теперь стандартные бенчмарки можно прогонять не только как «вопрос - ответ», а как полноценные агентные сценарии.
GSM8K, AIME, IFEval и SWE-Bench можно превратить в multi-turn задачи одной настройкой в конфиге. Дальше AgentLoop сам гоняет модель по циклу: сгенерировала шаг, вызвала инструмент, получила наблюдение, повторила.
Для оценки агентов это гораздо ближе к реальности. В проде модель редко просто отвечает текстом. Она вызывает функции, пишет код, запускает shell или Python, ошибается, читает вывод, чинит решение и идёт дальше.
В EvalScope теперь можно переключать стратегии: Function Calling, ReAct или SWE-Bench protocol. Можно сохранять полный trace: каждый шаг, ошибку, tool call и наблюдение. Потом всё это воспроизводится в Web Dashboard, что особенно полезно для дебага, а не только для красивой цифры в таблице.
Отдельно завезли безопасный sandbox через Docker и ms-enclave, чтобы shell и Python-инструменты запускались изолированно. Это важно, потому что агентные бенчмарки без sandbox быстро превращаются в рискованный запуск чужого кода.
Самое удобное - старые бенчмарки не надо переписывать. Включаешь Agent Mode в TaskConfig, и обычная проверка превращается в агентный прогон.
Судя по направлению, оценка AI-систем постепенно уходит от «какая модель умнее на статичном тесте» к более неприятному вопросу: как она ведёт себя в цикле, с инструментами, ошибками, ограничениями и реальным состоянием среды.
Вот это уже ближе к тому, что потом ломается в проде.
https://github.com/modelscope/evalscope
Post #5175
4.02K

- 👍 7
- ❤ 4
- 🥰 4
- 🔥 1
- 🙏 1