T в нашей любимой аббревиатуре ETL\ELT (выбрать любимую😍).Статья скорее более общая чем конкретная, но понравился подход команды автора к организации хранения SQL скриптов (см рисунок): раскладывать скрипты по папкам, соответствующим назначению.
Пожалуй такой подход можно перенести на организацию любимых
jupyter notebooks. Сейчас у меня в ходу такая иерархия:
./project folder - корневая папка проекта
- materials folder - папка для артефактов (графики, таблицы, вспомогательные данные, модели, метрики и др.)
- - datasets folder - хранение датасетов
- 1.ipynb
- 2.ipynb
- ...
В такой системе немаловажной ролью является название тетрадки, чтобы из него было понятно для его она, при добавлении subfolders по различным операциям (получение\очистка\подготовка датасетов, формирование новых признаков\моделирование....) улучшиться навигация (по крайней мере, при поиске не будут затрагиваться тетрадки совсем из другой историии).
А как вы организуете хранение ваших скриптов\ jupyter-тетрадок🤔
#post #dbt