TGViewer
Анализ данных (Data analysis) Анализ данных (Data analysis) @data_analysis_ml · 50.7K subscribers
Post #5175 4.02K
ModelScope добавили в EvalScope режим Agent Evaluation Mode. И это полезный сдвиг: теперь стандартные бенчмарки можно прогонять не только как «вопрос - ответ», а как полноценные агентные сценарии.

GSM8K, AIME, IFEval и SWE-Bench можно превратить в multi-turn задачи одной настройкой в конфиге. Дальше AgentLoop сам гоняет модель по циклу: сгенерировала шаг, вызвала инструмент, получила наблюдение, повторила.

Для оценки агентов это гораздо ближе к реальности. В проде модель редко просто отвечает текстом. Она вызывает функции, пишет код, запускает shell или Python, ошибается, читает вывод, чинит решение и идёт дальше.

В EvalScope теперь можно переключать стратегии: Function Calling, ReAct или SWE-Bench protocol. Можно сохранять полный trace: каждый шаг, ошибку, tool call и наблюдение. Потом всё это воспроизводится в Web Dashboard, что особенно полезно для дебага, а не только для красивой цифры в таблице.

Отдельно завезли безопасный sandbox через Docker и ms-enclave, чтобы shell и Python-инструменты запускались изолированно. Это важно, потому что агентные бенчмарки без sandbox быстро превращаются в рискованный запуск чужого кода.

Самое удобное - старые бенчмарки не надо переписывать. Включаешь Agent Mode в TaskConfig, и обычная проверка превращается в агентный прогон.

Судя по направлению, оценка AI-систем постепенно уходит от «какая модель умнее на статичном тесте» к более неприятному вопросу: как она ведёт себя в цикле, с инструментами, ошибками, ограничениями и реальным состоянием среды.

Вот это уже ближе к тому, что потом ломается в проде.

https://github.com/modelscope/evalscope
  • 👍 7
  • ❤ 4
  • 🥰 4
  • 🔥 1
  • 🙏 1
More from @data_analysis_ml
  1. Sep 30, 2026🧪 Новый бенчмарк проверяет не то, что ИИ знает, а способен ли он сам открыть неизвестные…
  2. Sep 30, 2026🛡 Большая подборка по безопасности AI-агентов и их skills На GitHub появился репозиторий…
  3. Sep 30, 2026Какие инструменты добавить в свой стек работы с данными? Работа с данными давно не огранич…
  4. Sep 30, 2026💸 Anthropic опубликовала практический гайд по снижению расходов на Claude API Главная мыс…
  5. Sep 30, 2026Что, если заменить аналитиков нейросетью? Да ничего хорошего: результаты анализа получаютс…
  6. Sep 30, 2026Согласны ?)
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →