🤔PandaSQL: Python-комбо для Data Scientis’а
SQL и Pandas – самые популярные инструменты дата-аналитика для управления табличными данными, их обработки и анализа. Их можно использовать по отдельности, а можно сразу в Python-пакете PandaSQL, который предоставляет возможности синтаксиса SQL в среде Python. PandaSQL позволяет запрашивать датафреймы Pandas средствами синтаксиса SQL.
PandaSQL – отличный инструмент для тех, кто знает SQL и не знаком с синтаксисом Python, который требуется Pandas. Например, в Pandas фильтрация датафрейма или группировка по определенному столбцу при агрегировании нескольких столбцов может показаться запутанной, в отличии от SQL. Однако эта простота использования SQL в Pandas сопряжена с огромными затратами избыточного времени выполнения. Например, чтобы рассчитать количество строк, PandaSQL требует почти в 100 раз больше времени выполнения, чем Pandas.
Кроме того, Python уже имеет множество имен, которые зарезервированы как ключевые слова, такие как for, while, in, if, else, elif, import, as и т. д. SQL вводит дополнительные ограничения на имена переменных за счет собственных ключевых слов: create, like, where, having.
Таким образом, с PandaSQL имеет смысл познакомиться, но этот интересный инструмент не подойдет для промышленного конвейера аналитики данных.
Примеры использования и сравнения времени выполнения: https://towardsdatascience.com/the-downsides-of-pandasql-that-no-one-talks-about-9b63c664bef4
Post #323
1.92K