TGViewer
OnlyAnalyst by Алексей Гаврилов OnlyAnalyst by Алексей Гаврилов @onlyanalystgroup · 2.45K subscribers
Post #65 771
😀 Всем привет!

🧭 В предыдущем посте обсуждали различные источники открытых данных для pet-проектов, но иногда запросы бывают довольно специфические и доступных наборов может не хватить, в таком случае на помощь приходят синтетические данные.

⛩️ В таком случаю помогут как специализированные библиотеки для создания «фэйковых» данных, так и более распространенные в узких кругах решения.

🎰 Библиотека Faker широко используется для создания реалистичных поддельных данных, таких как имена, адреса, номера телефонов и многое другое. Обеспечивает простой способ создания больших наборов данных с различными значениями.

from faker import Faker
import pandas as pd

fake = Faker()

# Generate fake names and addresses
data = {'Name': [fake.name() for _ in range(100)],
'Address': [fake.address() for _ in range(100)]}

df = pd.DataFrame(data)

df.head()

🧮
NumPy - это мощная библиотека для научных вычислений на Python. Он предоставляет функции для генерации массивов случайных чисел в соответствии с различными распределениями.

import numpy as np
import pandas as pd

random_integers = np.random.randint(low=1, high=100, size=1000)

random_normal = np.random.normal(loc=0, scale=1, size=1000)

data = {'Random_Integers': random_integers,
'Random_Normal': random_normal}

df = pd.DataFrame(data)

🐼
Pandas - популярная библиотека для обработки и анализа данных. Она включает в себя функции для создания синтетических данных с определенной структурой, таких как временные ряды или категориальные переменные.

import pandas as pd

dates = pd.date_range(start='2022-01-01', periods=365)

data = pd.DataFrame({'Date': dates, 'Value': np.random.rand(len(dates))})


🙇‍♂️ Scikit-Learn - это широко используемая библиотека машинного обучения, которая также предлагает инструменты для генерации данных. Функция make_classification() может создавать синтетические наборы данных.

from sklearn.datasets import make_classification
import pandas as pd

X, y = make_classification(n_samples=1000, n_features=5, n_informative=3, n_classes=2)

df = pd.DataFrame(X, columns=[f"Feature_{i+1}" for i in range(X.shape[1])])
df['Label'] = y

📚
Это всего лишь несколько примеров библиотек Python, доступных для генерации синтетических данных. В зависимости от ваших конкретных потребностей вы можете изучить эти библиотеки более подробно и найти ту, которая наилучшим образом соответствует вашим требованиям.

🥋 Теперь Вы знаете как создавать синтетические данные для тестирования, прототипирования или заполнения пробелов в ваших наборах данных!

✒️ Какие еще данные хотелось бы Вам создать? Приглашаю в комментарии для обсуждения.

#петпроект
Telegram Only Analyst 🫡 Всем привет! 🙋 Самый частый вопрос после «Кто сильнее Python или SQL?» - это «Как/какой/когда/зачем пет-проект сделать?». Поэтому будет серия статей, в первой мы разберем мотивацию и определение, а также поделюсь списком возможных источников данных. …
  • ❤ 13
  • 🥰 5
  • 👍 3
  • 🔥 1
More from @onlyanalystgroup
  1. Oct 1, 2026Что, если заменить аналитиков нейросетью? Да ничего хорошего: результаты анализа получаютс…
  2. Sep 24, 2026Post #492
  3. Aug 31, 2026Хорошие новости: все ребята с прошлого потока нашли работу. А значит, можно открывать осен…
  4. Aug 31, 2026OnlyAnalyst by Алексей Гаврилов pinned a photo
  5. Aug 19, 2026Бесплатный ии-агент, который мы заслужили Конечно же тут работает правило, что если что-то…
  6. Aug 10, 2026Новые времена требуют новых решений! Я поддался хайпу и полностью отказался от джунов и да…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →