Как мы обеспечили +33% к точности на сложных SQL-запросах
Сгенерировать SQL с помощью LLM — не проблема. Сделать так, чтобы он работал правильно и стабильно — уже вызов: модели путаются в диалектах, ломаются на сложных схемах и не понимают контекст.
Мы пошли нестандартным путем — обучили SQL-генератор не на синтетике, а на реальных PostgreSQL-базах с помощью обучения с подкреплением. Вместо подгона ответов под эталон, модель училась писать запросы, которые реально выполняются правильно.
Использовали GSPO (Group Sequence Policy Optimization) — вариант PPO, который оценивает качество не отдельных токенов, а всей последовательности. Модель Qwen3-0.6B дообучали три дня на двух собственных датасетах, где остались только корректно исполняемые SQL.
Получили +11% к точности выполнения (EX) и особенно сильный рост на сложных задачах: +33% в категории challenging.
Результаты в карточках, статью целиком читайте на Хабре.
Post #69
497




- 🔥 7
- 👍 2