Недавно опубликованные результаты бенчмарка FinSearchComp показали, как современные языковые модели справляются с задачами финансового анализа. Этот тест, включающий 635 вопросов, имитирует работу реальных финансовых аналитиков, оценивая их способности в поиске данных и логическом анализе.
Задачи делятся на три типа: работа с «горячими» данными (например, вчерашнее закрытие акций), точечный исторический поиск (например, активы Starbucks на определённую дату) и более сложные многошаговые расследования (например, анализ роста S&P 500 за несколько лет).
Кто в лидерах?
• Grok 4 показывает наилучшие результаты на глобальном наборе вопросов, набирая 68.9% по всем категориям
• GPT-5-Thinking также близок по точности, с результатом 63.9%
• Для китайского рынка лидер DouBao, но его результат в среднем — всего 54.2%, что значительно отстаёт от человеческой точности в 88.3%
Особенно сложными оказались многошаговые задачи (T3), где лучшие модели пока только дотягиваются до минимального уровня, который показывают профессиональные аналитики.
Хотя ИИ уже могут эффективно выполнять рутинную работу, такую как сбор данных и выполнение простых запросов, для сложных, многошаговых расследований, требующих логики и анализа множества источников, люди всё ещё на шаг впереди. Профессиональные финансовые аналитики пока не заменимы, особенно в задачах, требующих глубокого понимания контекста и способности работать с неоднозначными данными.
ИИ продолжает улучшаться в финансовом анализе, но пока остаётся гораздо более сильным помощником, чем самостоятельным экспертом. Если задачи становятся сложнее и многограннее, человеческий интеллект всё ещё не заменим 😮💨
Data Science
