Este projeto utiliza dados do Kaggle sobre o catálogo da Netflix e explora os padrões da arquitetura Medallion para organizar e processar dados em camadas de bronze, prata e ouro. A arquitetura Medallion permite um fluxo de dados escalável e confiável, com a transformação dos dados em cada camada para análise e visualização mais eficazes.
O objetivo deste projeto é demonstrar como implementar a arquitetura Medallion com dados reais do catálogo da Netflix, fornecendo insights sobre a organização e estruturação de dados para análises de alto desempenho.
A arquitetura Medallion é composta por três camadas principais:
- Camada Bronze: Dados brutos, sem transformações.
- Camada Prata: Dados limpos e transformados, com validação e algumas agregações.
- Camada Ouro: Dados agregados e prontos para análise ou visualização, oferecendo insights mais profundos.
Para rodar este projeto, você precisará das seguintes bibliotecas Python:
pandaspyarrowos
Além disso, você precisará de uma conta no Kaggle para acessar os dados do catálogo da Netflix.
Clone este repositório para o seu ambiente local:
git clone https://https://github.com/Roodzz/netflix_medallion.git
cd netflix_medallionRecomenda-se criar um ambiente virtual para instalar as dependências isoladamente. No terminal, execute:
python -m venv venv- No Windows:
venv\Scripts\activate
- No macOS/Linux:
source venv/bin/activate
Instale as bibliotecas necessárias, utilizando o arquivo requirements.txt:
pip install -r requirements.txtPara baixar os dados do Kaggle, siga os seguintes passos:
-
Crie uma conta no Kaggle e obtenha a chave API em https://www.kaggle.com/docs/api.
-
Após configurar a chave API, use o comando abaixo para baixar os dados do catálogo da Netflix:
kaggle datasets download -d <dataset-name>
Substitua
<dataset-name>pelo nome do conjunto de dados que você deseja usar.
Depois de configurar o ambiente, você pode executar os scripts para processar e analisar os dados, aplicando a arquitetura Medallion.
python process_data.pyOs resultados do processamento estarão disponíveis na camada "Ouro", onde você pode analisar e visualizar os insights extraídos dos dados do catálogo da Netflix.
Contribuições são bem-vindas! Se você tem sugestões ou melhorias para o projeto, sinta-se à vontade para abrir um pull request.