TGViewer
Datanomika Datanomika @datanomika · 2.72K subscribers
Post #1000 548
Самая недооценённая работа этого года про text-to-SQL

В январе на CIDR вышла статья с названием, которое не оставляет пространства для интерпретаций: [«Text-to-SQL Benchmarks are Broken»](https://www.vldb.org/cidrdb/papers/2026/p5-jin.pdf).

Четверо исследователей из UIUC вручную перепроверили эталонные ответы в двух самых цитируемых бенчмарках. РАХМЕТ им большой за это

Результат:
• BIRD Mini-Dev, 498 примеров — ошибки разметки в 52.8% задач. Предыдущая работа находила 36.1%, то есть нашли ещё 102 сломанных примера
• Spider 2.0-Snow — из 121 задачи с опубликованными эталонами проблемными оказались 80. Это 66.1%

Порядок в лидерборде частично определялся тем, чьи ошибки удачнее совпали с ошибками разметки

Речь именно про эталоны. Про те самые правильные ответы, с которыми сравнивают модель

Что конкретно сломано

• Эталон вызывает ST_POINT(26.75, 51.5), а Snowflake ждёт порядок «долгота, широта». Координаты перепутаны в самом эталоне

• Вопрос про учеников с 1 по 12 класс, эталон берёт колонку Enrollment (K-12) — а она включает подготовительный. Эталон отвечает не на заданный вопрос

• TO_TIMESTAMP(end_date) даёт начало последнего дня вместо конца. Эталон молча теряет все события после полуночи

• После JOIN и FLATTEN строки размножились, DISTINCT не поставили — эталон считает дубликаты

• Семь вопросов с неоднозначным форматом вывода: оставил кавычки — ответ признан неверным

Последнее особенно показательно. Агент отвечает правильно и получает ноль за форматирование

А дальше самое интересное

Авторы взяли пять топовых агентов с лидерборда BIRD и прогнали их на исправленной выборке из 100 задач

Точность поехала на от −3% до 31% в относительном выражении, рейтинг перетасовался на три позиции.
Агент CHESS стоял четвёртым — поднялся с 62% до 81% и стал первым. OpenSearch-SQL стоял первым — опустился с 71% до 69% и стал третьим

То есть порядок в лидерборде частично определялся тем, чьи ошибки удачнее совпали с ошибками разметки

Две оговорки, без них нечестно

Команда Spider 2.0 обновила формулировки вопросов в июле 2025 и часть неоднозначностей сняла, а аудит делали по более раннему срезу. И 66.1% — это доля среди 121 проверенной задачи из 547, а не по всему датасету

Но вывод не меняется

Когда вам показывают девяносто с чем-то процентов на публичном text-to-SQL бенчмарке, в этой цифре есть вклад ошибок разметки. И ни вы, ни автор цифры не знаете, какой именно

Поэтому единственная осмысленная метрика для вашей компании — внутренний eval на ваших схемах, ваших определениях метрик и реальных вопросах бизнеса. Чужой лидерборд на этот вопрос не отвечает

А вы свои цифры точности на чём меряете?
  • ❤ 2
More from @datanomika
  1. Sep 30, 2026Хочу жить так, чтобы стебаться и троллить как Илон Маск 🤣
  2. Sep 30, 2026Наткнулся на одного парня в ютубе. Он уже 11 лет (с детства) занимается созданием экзоскел…
  3. Sep 24, 2026AWS Innovation Day 2026: от AI-пилотов к реальным решениям 22 октября в Astana Hub, Астана…
  4. Sep 23, 2026Kwai (Kuaishou), разработчик генеративной видеомодели Kling AI, перенесла общекорпоративны…
  5. Sep 21, 2026Протестировал модель нового типа Jev на задаче реранкинга для классификации госзакупок по…
  6. Sep 18, 202680% рынка автозапчастей уже внутри redflags.ai Теперь - ещё ближе к реальной закупке Мы за…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →