A deep learning-based bird species recognition system using bird audio recordings and mel spectrogram classification.
This project identifies bird species from their sound recordings using:
- Audio preprocessing
- Mel spectrogram generation
- Deep learning classification
- Transfer learning with EfficientNet
The system converts bird audio into spectrogram images and classifies them into bird species categories.
- Bird audio loading with Librosa
- Mel spectrogram generation
- EfficientNet-based CNN classifier
- Audio augmentation
- Training + validation pipeline
- Model inference pipeline
- GPU-ready training support
data/
│
├── train_audio/
├── train_soundscapes/
├── test_soundscapes/
│
├── train.csv
├── taxonomy.csv
├── sample_submission.csv
└── train_soundscapes_labels.csv
- Python
- PyTorch
- Librosa
- TIMM
- Audiomentations
- Scikit-learn
- EfficientNet-B0
- Mel Spectrogram Input
- Transfer Learning
- Dropout Regularization
Audio
↓
Mel Spectrogram
↓
Normalization
↓
EfficientNet
↓
Classification
pip install -r requirements.txtpython src/train.pypython src/inference.py- Working preprocessing pipeline
- Spectrogram visualization
- EfficientNet training
- Validation support
- Audio augmentation
- GPU migration planned
- Full dataset training
- Multi-label classification
- AST / BirdNET integration
- Soundscape inference
- Competition submission pipeline
Pari Jain