This project focuses on data cleaning, preprocessing, and class balancing of the Palmer Penguins dataset using Python and Jupyter Notebook.
The dataset is used as an alternative to the Titanic dataset for practicing data science techniques.
- Data Exploration: Checking dataset structure, summary statistics, and missing values.
- Data Cleaning:
- Handled missing values with median/mode imputation.
- Removed duplicate rows.
- Detected outliers in numerical features.
- Feature Engineering:
- Encoded categorical variables (
sex,island) using Label Encoding and One-Hot Encoding.
- Encoded categorical variables (
- Visualization:
- Countplots and boxplots to explore data distribution.
- Data Balancing:
- Used SMOTE to handle class imbalance.
- Data Splitting:
- Split dataset into training and testing sets.
To practice data preprocessing, cleaning, and balancing techniques as preparation for machine learning workflows.
penguinsProject.ipynbβ Main notebook with code and outputs.penguins.csvβ Dataset file.