🏂Apache Spark для Data Scientist’а: краткий ликбез по ML-пакетам
Data Scientist’ы любят фреймворк Apache Spark не только за способность очень быстро обрабатывать действительно большие объемы данных, но и за наличие популярных алгоритмов машинного обучения (классификация, регрессия, кластеризация, фильтрация) и средств подготовки данных к моделированию (очистка, извлечение признаков, преобразование и пр.), а также алгебраических и статистических функций. Все это упаковано в специальные пакеты: MLLib (spark.mllib) и и ML (spark.ml) соответственно.
Интересно, что «Spark ML» не является официальным названием библиотеки в пакете spark.ml, но часто используется для обозначения API MLlib на основе DataFrame, в отличие от spark.mllib, которая работает со структурами данных более низкого уровня – RDD (Resilient Distributed Dataset, надежная распределенная коллекция типа таблицы). При этом официальная документация Apache Spark подчеркивает, что оба API поддерживаются и ни один из них не является устаревшим. Однако, на практике большинство современных разработчиков Spark-приложений, аналитиков данных и Data Scientist’ов работают именно со пакетом spark.ml из-за гибкого и удобного API DataFrame.
Post #23
181