Este repositorio reúne distintos proyectos de análisis de datos y Machine Learning desarrollados con fines de aprendizaje y experimentación.
Cada proyecto utiliza un dataset diferente para recorrer el flujo completo de un problema de ciencia de datos, desde la comprensión y preparación de la información hasta el entrenamiento, evaluación e interpretación de modelos predictivos.
La idea es construir un espacio donde documentar el proceso de aprendizaje, comparar metodologías y poner en práctica distintas herramientas utilizadas en Data Science.
Cada carpeta corresponde a un proyecto independiente desarrollado sobre un dataset específico.
Dependiendo del caso de estudio, los proyectos pueden incluir:
- 📥 Ingesta y preparación de datos
- 🔍 Análisis exploratorio (EDA)
- 🧹 Limpieza y transformación de datos
- ⚙️ Feature Engineering
- 📊 Visualización de datos
- 🤖 Desarrollo de modelos predictivos
- 📈 Evaluación y comparación de modelos
- 💡 Obtención e interpretación de insights
- 🚀 Construcción de Pipelines
A medida que el repositorio crezca, se incorporarán distintos enfoques de análisis y modelado, entre ellos:
- Regresión lineal
- Regresión logística
- K-Nearest Neighbors (KNN)
- Árboles de decisión
- Random Forest
- XGBoost
- Clustering
- Validación cruzada
- Selección de variables
- Ingeniería de características
- Python
- Pandas
- NumPy
- Scikit-learn
- Matplotlib
- Plotly
- Jupyter Notebook
- SQL
- Git & GitHub
Este repositorio busca fortalecer conocimientos en Ciencia de Datos mediante la resolución de problemas reales utilizando diferentes datasets, documentando cada etapa del proceso y comparando distintas metodologías de análisis y modelado.
Proyecto en constante crecimiento.
Se irán incorporando nuevos datasets, notebooks, técnicas de análisis y modelos a medida que avance el aprendizaje.
Este repositorio fue desarrollado utilizando como punto de partida los conocimientos y herramientas aprendidos durante el curso de Talento Tech ❤️.