Практический вывод из этого прямой. Публичный лидерборд не отвечает на вопрос, насколько хорошо агент будет работать в вашей компании: он измеряет чужую систему на чужих схемах чужой разметкой.
Содержательный ответ даёт только внутренний eval на ваших определениях метрик, ваших схемах и ваших реальных ошибках.
Post #1001
502
Datanomika Самая недооценённая работа этого года про text-to-SQL В январе на CIDR вышла статья с названием, которое не оставляет пространства для интерпретаций: [«Text-to-SQL Benchmarks are Broken»](https://www.vldb.org/cidrdb/papers/2026/p5-jin.pdf). Четверо исследователей…