Skip to content

Latest commit

Β 

History

2 Commits

Folders and files

NameName
Last commit message
Last commit date
Β 
Β 
Β 
Β 

Repository files navigation

Penguins Data Cleaning & Preprocessing 🐧

This project focuses on data cleaning, preprocessing, and class balancing of the Palmer Penguins dataset using Python and Jupyter Notebook.
The dataset is used as an alternative to the Titanic dataset for practicing data science techniques.


πŸ“Š Main Steps

  • Data Exploration: Checking dataset structure, summary statistics, and missing values.
  • Data Cleaning:
    • Handled missing values with median/mode imputation.
    • Removed duplicate rows.
    • Detected outliers in numerical features.
  • Feature Engineering:
    • Encoded categorical variables (sex, island) using Label Encoding and One-Hot Encoding.
  • Visualization:
    • Countplots and boxplots to explore data distribution.
  • Data Balancing:
    • Used SMOTE to handle class imbalance.
  • Data Splitting:
    • Split dataset into training and testing sets.

🎯 Project Goal

To practice data preprocessing, cleaning, and balancing techniques as preparation for machine learning workflows.


πŸ“‚ Files

  • penguinsProject.ipynb β†’ Main notebook with code and outputs.
  • penguins.csv β†’ Dataset file.

About

Data cleaning, preprocessing, and class balancing of the Palmer Penguins dataset using Python (pandas, seaborn, scikit-learn, imbalanced-learn). Includes handling missing values, outliers, encoding, visualization, and SMOTE.

Topics

Resources

Stars

0 stars

Watchers

0 watching

Forks

Releases

Packages

Contributors

Languages