В январе на CIDR вышла статья с названием, которое не оставляет пространства для интерпретаций: [«Text-to-SQL Benchmarks are Broken»](https://www.vldb.org/cidrdb/papers/2026/p5-jin.pdf).
Четверо исследователей из UIUC вручную перепроверили эталонные ответы в двух самых цитируемых бенчмарках. РАХМЕТ им большой за это
Результат:
• BIRD Mini-Dev, 498 примеров — ошибки разметки в 52.8% задач. Предыдущая работа находила 36.1%, то есть нашли ещё 102 сломанных примера
• Spider 2.0-Snow — из 121 задачи с опубликованными эталонами проблемными оказались 80. Это 66.1%
Порядок в лидерборде частично определялся тем, чьи ошибки удачнее совпали с ошибками разметки
Речь именно про эталоны. Про те самые правильные ответы, с которыми сравнивают модель
Что конкретно сломано
• Эталон вызывает
ST_POINT(26.75, 51.5), а Snowflake ждёт порядок «долгота, широта». Координаты перепутаны в самом эталоне• Вопрос про учеников с 1 по 12 класс, эталон берёт колонку
Enrollment (K-12) — а она включает подготовительный. Эталон отвечает не на заданный вопрос•
TO_TIMESTAMP(end_date) даёт начало последнего дня вместо конца. Эталон молча теряет все события после полуночи• После JOIN и FLATTEN строки размножились,
DISTINCT не поставили — эталон считает дубликаты• Семь вопросов с неоднозначным форматом вывода: оставил кавычки — ответ признан неверным
Последнее особенно показательно. Агент отвечает правильно и получает ноль за форматирование
А дальше самое интересное
Авторы взяли пять топовых агентов с лидерборда BIRD и прогнали их на исправленной выборке из 100 задач
Точность поехала на от −3% до 31% в относительном выражении, рейтинг перетасовался на три позиции.
Агент CHESS стоял четвёртым — поднялся с 62% до 81% и стал первым. OpenSearch-SQL стоял первым — опустился с 71% до 69% и стал третьим
То есть порядок в лидерборде частично определялся тем, чьи ошибки удачнее совпали с ошибками разметки
Две оговорки, без них нечестно
Команда Spider 2.0 обновила формулировки вопросов в июле 2025 и часть неоднозначностей сняла, а аудит делали по более раннему срезу. И 66.1% — это доля среди 121 проверенной задачи из 547, а не по всему датасету
Но вывод не меняется
Когда вам показывают девяносто с чем-то процентов на публичном text-to-SQL бенчмарке, в этой цифре есть вклад ошибок разметки. И ни вы, ни автор цифры не знаете, какой именно
Поэтому единственная осмысленная метрика для вашей компании — внутренний eval на ваших схемах, ваших определениях метрик и реальных вопросах бизнеса. Чужой лидерборд на этот вопрос не отвечает
А вы свои цифры точности на чём меряете?