👩❤️💋👨 Приглашаю всех принять участие в моем новом Open Source проекте Synthetic Data Generator.
👫 Мы с Вами сделаем свой собственный генератор синтетических DataFrame, который можно будет использовать для пет-проектов.
🗼Для Вас отличная возможность:
👫 поработать в команде и сделать интересный data-product
⚒ получить реальный опыт с Git
📂 добавить в резюме Open Source проект, что выгодно выделит Вас среди кандидатов
😊 просто хорошо провести время.
🍼 Так что если еще не зарегистрировались на GitHub, то самое время это сделать и начать отслеживать проект.
🙋 Всех участников добавлю в Contributors в описание проекта, даже если просто исправили орфографическую ошибку в описании (там есть 🙃)
👷 Теперь немного о самом проекте, с функцией можете ознакомиться в исходном коде, все необходимые комментарии присутствуют.
🌈 Изначально создаем список, с название столбцов и их типом, пока поддерживаются
int, float, str и date:
column_specs = [
('Column1', 'int'),
('Column2', 'float'),
('Column3', 'str'),
('Column4', 'date')
]
📜 Далее указываем необходимое количество строк:num_rows = 10
🪫 Выбираем False или True для параметра, которые отвечает за наличие в DataFrame Null. include_nulls = False
📖 Передаем список категорий, которые будут использоваться в категориальном слолбце: str_categories = ['apple', 'banana', 'cherry', 'orange']
⌛️ Для столба с временем задаем диапазон дат: start_date = '2022-01-01'
end_date = '2022-12-31'
🚋 Вызываем функцию со всеми необходимыми параметрами и на выходе получаем готовый DataFrame. df = generate_synthetic_data(column_specs, num_rows, include_nulls, str_categories, start_date, end_date)
print(df)
🛟 Идей по развитию очень много: добавить возможность контроля распределения численных колонок, добавлять Null значения не ко всему DataFrame, а определенными колонкам. ⁉️ Если есть вопросы по работе с Git или по функциям, то смело пишите в комментариях к посту. Жду Ваших
pull request 🥰#проект #петпроект #opensource
