FinFIRST - финансовый бенчмарк, который проверяет не только ответ, но и весь путь к нему
Ant Group вместе с инвестиционно-банковской командой CICC и более чем 50 финансовыми специалистами разработала FinFIRST - бенчмарк для оценки AI-агентов на реальных финансовых задачах.
Он проверяет:
- как агент ищет источники
- насколько свежие данные использует
- умеет ли объединять несколько источников
- выбирает ли надёжные доказательства
- правильно ли считает
- насколько легко проверить полученный результат
Задачи охватывают Китай, США, Гонконг и другие рынки:
- 60,2% - на китайском
- 39,8% - на английском
- 61,8% требуют явных вычислений
- 32,5% требуют нескольких источников
- в 75,6% случаев агент сам должен найти и выбрать источники
Для сравнения протестировали 15 конфигураций моделей в одинаковом ReAct-сетапе с Web Search, Visit и Python.
Ling-3.0-flash-Fin набрала 82,45% по source verification, показав один из сильных результатов среди протестированных open-weight моделей.
Уже готовится FinFIRST V2 - с более широким набором задач по финансовому поиску и сложным research-сценариям.
https://huggingface.co/datasets/inclusionAI/FinFIRST
Post #1976
1.52K


- 👍 2
- ❤ 1