Este proyecto tiene como objetivo analizar y modelar el mercado de vehículos usados en Estados Unidos utilizando datos provenientes de Craigslist. A través de técnicas de aprendizaje automático supervisado, se desarrollan modelos capaces de:
- Predecir el precio de un vehículo usado.
- Clasificar si un vehículo tiene alta o baja demanda.
El enfoque incluye un flujo completo de ciencia de datos: desde la adquisición y procesamiento de datos hasta la construcción, optimización y evaluación de modelos.
- Cristian Camilo Linero Cantillo (https://github.com/cristianclc)
- David Ricardo Marquez Luna (https://github.com/DAVIDML2005)
- Fuente: Kaggle
- Autor: Austin Reese
- Enlace: https://www.kaggle.com/datasets/austinreese/craigslist-carstrucks-data
Diseñar modelos supervisados de regresión y clasificación utilizando técnicas de regularización e integrados en pipelines optimizados con validación cruzada.
-
Implementar un pipeline de preprocesamiento:
ColumnTransformerOneHotEncoderStandardScaler
-
Entrenar modelos de regresión:
- Ridge
- Lasso
- Optimización con
GridSearchCV
-
Construir modelo de clasificación:
- Regresión Logística
- Clasificación de demanda (HighDemand vs LowDemand)
-
Evaluar modelos de regresión:
- MAE
- RMSE
- R²
-
Comparar modelos Ridge vs Lasso
-
Evaluar modelo de clasificación:
- Accuracy
- Precisión
- Recall
- F1-score
- Curva ROC y AUC
El proyecto sigue un flujo estructurado:
- Recolección de datos.
- Limpieza y preprocesamiento.
- Ingeniería de características.
- Construcción de pipelines.
- Entrenamiento de modelos.
- Optimización de hiperparámetros (GridSearchCV).
- Evaluación y comparación de modelos.
- Interpretación de resultados.