Complete Python Topics for Data Analysis: https://t.me/sqlspecialist/548
Data Cleaning and Preprocessing:
1. Handling Missing Data:
- Identifying Missing Values:
df.isnull() # Boolean DataFrame indicating missing values
- Dropping Missing Values:
df.dropna() # Drop rows with missing values
- Filling Missing Values:
df.fillna(value) # Replace missing values with a specified value
2. Removing Duplicates:
- Identifying Duplicates:
df.duplicated() # Boolean Series indicating duplicate rows
- Removing Duplicates:
df.drop_duplicates() # Remove duplicate rows
3. Data Normalization and Scaling:
- Min-Max Scaling:
from sklearn.preprocessing import MinMaxScaler
scaler = MinMaxScaler()
df_scaled = scaler.fit_transform(df[['feature']])
- Standardization:
from sklearn.preprocessing import StandardScaler
scaler = StandardScaler()
df_standardized = scaler.fit_transform(df[['feature']])
4. Handling Categorical Data:
- One-Hot Encoding:
pd.get_dummies(df['categorical_column'])
- Label Encoding:
from sklearn.preprocessing import LabelEncoder
label_encoder = LabelEncoder()
df['encoded_column'] = label_encoder.fit_transform(df['categorical_column'])
Understanding data cleaning and preprocessing is crucial for ensuring the quality and suitability of your data for analysis.
Share with credits: https://t.me/sqlspecialist
Hope it helps :)