А вы уже перешли на Polars?
Pandas долго была незаменимым инструментом для аналитиков и дата-сайентистов, но скорости работы ей не хватает, а памяти она требует достаточно. Даже выход Pandas 2.0 не смог решить эти проблемы, зато смогла Polars. Или нет?
Коротко про Polars
🔵 Это open source библиотека для обработки больших массивов данных на Python и Rust. Написана на Rust и основана на Apache Arrow.
🔵 Polars задействует все ядра компьютера для параллельных вычислений. Благодаря этому она более эффективно использует ресурсы компьютера, чем Pandas, и работает быстрее. На этом еще остановимся подробнее.
🔵 Два API: eager и lazy. Первый выполняет операции в том порядке, в котором они написаны в коде. Второй оптимизирует последовательность выполнения так, чтобы она была максимально эффективной и не перегруженной лишними вычислениями.
Polars вышла в 2020 году. За это время она успела завоевать популярность, но до сих пор не перестала попадать в статьи «топ новых инструментов для аналитиков». Создатель Polars хотел разработать инструмент, соответствующий современным требованиям и подходам к работе с данными. Библиотека писалась с нуля так, чтобы добиться максимальной производительности на одной машине.
🔵 Polars требует в разы меньше памяти, чем Pandas. Последней нужно, чтобы объем RAM был в 5-10 раз больше датасета, а первой — только в 2-4 раза.
🔵 Polars действительно «blazingly fast», как и обещает на сайте. Она быстрее Pandas и в сравнении с остальными подобными инструментами устойчиво держится в топе по скорости.
🔵 Субъективно, но есть мнение, что Polars достаточно похожа Pandas, чтобы перейти на нее было легко, но достаточно отличается, чтобы быть удобнее. Вот еще статья на русском, в которой можно посмотреть, как Polars выглядит на практике.
В общем, мы считаем, что Polars мировую любовь заслужила не зря. А что думаете вы? 👀
Post #1158
22.9K

- ❤ 29
- 🔥 17
- 👍 10
- 🙈 2
- 👎 1