💡😎📊Синтетический набор данных Text-to-SQL с открытым исходным кодом
Gretel выпустила крупнейший набор данных Text-to-SQL с открытым исходным кодом для ускорения обучения моделей ИИ
Как утверждают разработчики, по состоянию на апрель 2024 года набор данных считается самым большим и разнообразным синтетическим набором данных преобразования текста в SQL, доступным на сегодняшний день.
Датасет содержит около 23 млн. токенов, включая около 12 млн токенов SQL, а также широкий диапазон уровней сложности SQL, включая подзапросы, одиночные соединения, множественные соединения, агрегации, оконные функции и операции над множествами.
Для загрузки датасета через Python API, необходимо прописать следующи скрипт:
from datasets import load_dataset
dataset = load_dataset("gretelai/synthetic_text_to_sql")
Post #548
822