Идеи для пет-проектов в геоаналитике со спутниковыми снимками
Допустим, мы научились генерить пространственные фичи. Самое интересное, что данные у нас могут быть не только lat, lon в чистом виде или преобразованном, а еще у нас может быть много дополнительных данных. Короче го брать спутниковые снимки.
На основе свежих статей я подобрал некоторый шортлист задач, где можно попробовать потыкать ML/DL:
1️⃣Оценка потенциала солнечной энергетики (Urban Planning) - по мотивам этой статьи
Задача: Оценить, сколько солнечных панелей можно установить на крышах зданий эффективно.
Что брали в статье: Модель детекции объектов (YOLO) или сегментации (U-Net) для поиска крыш на спутниковых снимках
Что делать: Обучить модель на размеченных данных, чтобы она находила крыши
Улучшение: Добавить данные о затененности от других зданий для более точного расчета выработки энергии. Дополнительно можно попробовать оценить оптимальный угол наклона панели и соответствует ли он наклону крыши.
2️⃣Поиск самых жарких кварталов города (тоже про урбанистику) - по мотивам другой статьи
Задача: Предсказать, какие участки города будут перегреваться сильнее всего летом.
Данные: Типы застройки (land cover), плотность озелененной территории, топография, расстояние до береговых линий и воды.
Что в статье: Natural Gradient Boosting или Deep Neural Networks. В статье дошли до R2 ~ 0.9 на тесте с NGBR. Вы кстати можете затестить катбуст.
Что делать: Собрать все факторы по городской сетке, сгенерить фичи (например, % озелененной территориии в радиусе 500м) и обучить хотя бы регрессионную модель.
Улучшение: Добавить данные о высоте зданий (влияет на проветриваемость) и интенсивности трафика (доп. источник тепла).
3️⃣Поиск аномальных изменений (Anomaly Detection) - можно взять эту статью (там кстати прям с кодом внутри статьи)
Задача: Находить на снимках аномальные изменения, допустим вырубка лесов (deforestation).
Данные: Распределенные по времени спутниковые снимки (например, Landsat). Их кстати надо обрабатывать
Бейзлайн: Сравнение снимков, относящихся к одним координатам попиксельно в разные промежутки времени.
Что делать: Применить модели для поиска аномалий, (база - Isolation Forest) на данных об изменениях в ландшафте
Улучшение: Для искушенных можно затестить DeepIsolationForest
4️⃣Поиск зон затопления (Flood Hazard) - по этому поводу кстати статей много, допустим берем эту
Задача: Спрогнозировать, какие территории с наибольшей вероятностью пострадают от наводнения.
Данные: Спутниковые снимки взять cо Scihub Copernicus (SAR, Sentinel-1) (с российских ip не работает, как грузить вроде была инфа на гитхабах), дополнительно можно собрать разные геоданные (рельеф, тип почвы, осадки). Таргет можно собрать здесь
Бейзлайн: Random Forest или градиентный бустинг (CatBoost). В статье например модели бустингов показывают норм точность > 80-90%.
Что делать: По классике собрать все геофичи в один датасет и обучить модель на исторических данных о затоплениях. Не забыть про SHAP, чтобы объяснить, почему модель считает именно эту зону целевой.
Улучшение: Затестить например GEE (Google Earth Engine)
Если вам ничего не откликнулось, то усредненный проект в геоаналитике с точки зрения спутниковых снимков и ML/DL можно представить вот так:
▫️Собрать побольше данных: спутниковые снимки, статистика, опенсурсные данные с каких-либо датчиков.
▫️Допустим, навесить много моделек: начиная с ванильного CNN, затем U-Net, YOLO, SAM, CLIP или что уже душе угодно. Особо изысканные могут затестить TernausNet 😐
▫️Ну или например взять предобученные на геоданных модели. Есть допустим библиотека TorchGeo
▫️Найти для себя любой интересующий вас таргет. И дальше уже тыкать модельки на фичах.
▫️По желанию интерпретируемость с LIME или SHAP
Проекты в геоаналитике — это не просто таблички, а возможность поработать со спутниковыми снимками, картами и реальными проблемами городов и планеты. Идеи можно подбирать со статей, а данные с открытых источников. Короче, все зависит от нашего желания.
Кидайте в коменты ваши проекты с геоаналитикой 👍
#geoanalytics #ml #dl #petproject
Post #876
1.32K