Deesseia from the French déesse (goddess), pronounced like the letters D-S.
Deesseia simplifies data science workflows. It's an open-source, lightweight Python toolkit that provides a unified, intuitive interface from prototype to production, removing the friction of juggling multiple libraries so you can focus on solving problems, not managing dependencies.
deesseia (ds)
│
├── core # Foundations: loading, cleaning, feature engineering
├── eda # Exploratory Data Analysis & statistics
├── viz # Visualization & geospatial
├── preprocess # Scaling, encoding, imputation, splitting
├── ml # Core ML: regression, classification, ensembles
├── dl # Deep Learning: CNNs, RNNs, Transformers
├── nlp # Natural Language Processing
├── llm # Large Language Models & RAG
├── search # Retrieval & vector search
├── cv # Computer Vision
├── ts # Time Series
├── graph # Graph ML & Knowledge Graphs
├── rl # Reinforcement Learning
├── metrics # Evaluation metrics
├── evaluate # Cross-validation, ROC, calibration
├── explain # SHAP, LIME, feature importance
└── utils # Logging, config, reproducibility
| Domain | Subdomains |
|---|---|
| Core Foundations | Data Loading, Data Cleaning, Data Preprocessing, Feature Engineering, Data Validation |
| Exploratory Data Analysis | Descriptive Statistics, Inferential Statistics, Hypothesis Testing, Probability Distributions, Correlation Analysis, Missing Value Analysis |
| Visualization | Statistical Plots, Interactive Dashboards, Geospatial Mapping, Data Storytelling |
| Preprocessing | Scaling, Encoding, Imputation, Splitting |
| Machine Learning | Regression (Linear, Ridge/Lasso, Polynomial, SVR, Tree-based), Classification (Logistic, Naive Bayes, KNN, SVM, Decision Trees, Random Forest, XGBoost/LightGBM/CatBoost), Unsupervised (Clustering: K-Means, Hierarchical, DBSCAN, GMM; Dimensionality Reduction: PCA, t-SNE, UMAP, LDA) |
| Deep Learning | Neural Networks (MLP, CNNs, RNNs/LSTMs, Transformers), Advanced Architectures (Autoencoders, VAEs, GANs, Diffusion Models), Transfer Learning (Fine-tuning, Feature Extraction) |
| Natural Language Processing | Text Preprocessing (Tokenization, Stemming, Lemmatization), Text Representation (Bag-of-Words, TF-IDF, Word Embeddings, Sentence Embeddings), Core Tasks (NER, POS Tagging, Dependency Parsing, Text Classification, Sentiment Analysis, Topic Modeling, Summarization) |
| Large Language Models & Agents | Language Models (GPT, LLaMA, Mistral, BERT), Prompt Engineering (Zero/Few-shot, Chain-of-Thought), Fine-tuning (SFT, RLHF, PEFT/LoRA), RAG (Retrieval, Generation, GraphRAG), AI Agents (Tool Calling, ReAct, Multi-agent Systems) |
| Search & Retrieval | Sparse Retrieval (BM25, TF-IDF), Dense Retrieval (Embeddings, Vector Search), Hybrid (RRF, Reranking) |
| Computer Vision | Image Processing, Object Detection (YOLO, R-CNN, SSD), Segmentation (Semantic, Instance, Panoptic), OCR (Tesseract, PaddleOCR) |
| Time Series | Decomposition (Trend, Seasonality), Forecasting (ARIMA, SARIMA, Prophet, LSTM-TS), Anomaly Detection |
| Graph & Geometric ML | Graph Analytics (Centrality, Community Detection), GNNs (GCN, GAT, GraphSAGE), Knowledge Graphs (GraphRAG, Ontologies) |
| Reinforcement Learning | Value-based (Q-Learning, DQN), Policy-based (PPO, A2C, DDPG), MDP |
| Evaluation Metrics | Classification Metrics (Accuracy, Precision, Recall, F1, ROC-AUC, PR-AUC), Regression Metrics (MAE, MSE, RMSE, R², MAPE, SMAPE, MASE), Ranking Metrics (nDCG, MRR, Recall@k), Clustering Metrics (Silhouette, Davies-Bouldin, Calinski-Harabasz) |
| Model Evaluation | Cross-Validation, Model Calibration, Drift Detection, Model Monitoring, Experiment Tracking |
| Explainability | SHAP, LIME, Feature Importance, Model Interpretability |
| Utilities | Logging, Configuration Management, Reproducibility, Model Deployment |
A detailed roadmap with all versions, phases, and key features is available in ROADMAP.md.
High-level overview:
| Major Version | Phase | Focus | Status |
|---|---|---|---|
| v1.x.x | Foundations | Data loading, cleaning, EDA, visualization, preprocessing | In Development |
| v2.x.x | Core ML | Regression, classification, unsupervised, model evaluation | Planned |
| v3.x.x | Advanced ML | Deep learning, NLP, LLMs, computer vision, audio | Planned |
| v4.x.x | Specialized | Time series, graph ML, reinforcement learning, Bayesian | Planned |
| v5.x.x+ | Evolution | Continuous improvement, community-driven | Future |
pip install deesseiaWith optional dependencies:
Coming soon
For development:
# 1. Create virtual environment
python -m venv .venv
# 2. Activate it
# On macOS/Linux:
source .venv/bin/activate
# On Windows:
.venv\Scripts\activate
# 3. Install the package in development mode with dev dependencies
pip install -e ".[dev]"import deesseia as ds
# Load data
df = ds.DataLoader.from_csv("data.csv")
# Clean data
cleaner = ds.Cleaner(df)
df = cleaner.handle_missing("mean")
# Inspect data
inspector = ds.DataInspector()
summary = inspector.summary(df)
# Validate data
validator = ds.Validator()
errors = validator.validate_schema(df, {"id": "int64", "name": "object"})We welcome contributions! Please see CONTRIBUTING.md for guidelines on commit conventions, SOLID principles, and code quality.
Comprehensive documentation is available at deesseia.readthedocs.io.
See LICENSE for details.
All notable changes are documented in CHANGELOG.md following Keep a Changelog.
- Maintainer: Jean Decian