PT: Analista de Dados e Negócios Jurídicos · Jurimetrista
EN: Data & Legal Business Analyst · Jurimetrics Specialist
Dashboards · Machine Learning · Business Intelligence · End-to-end Data Pipelines · Medallion Architecture
🇧🇷 Português
Sou Analista de Dados e Jurimetrista com foco na construção de soluções preditivas e otimização de infraestruturas de dados. Minha atuação combina Ciência de Dados, Engenharia e Business Intelligence para transformar grandes volumes de informação em ativos estratégicos e redução de passivos financeiros.
Especialidades Técnicas:
Data Science e Jurimetria: Modelagem estocástica com Random Forest para predição de risco e provisionamento dinâmico de processos judiciais.
Engenharia de Dados: Desenvolvimento de pipelines, Databricks, Cloud, orquestração no Apache Airflow, processamento em Spark, ETL e gestão de bancos de dados SQL e NoSQL (Redis, Cassandra, MongoDB), com foco em escalabilidade e baixa latência.
Business Intelligence: Criação de dashboards executivos em Streamlit e Power BI para monitoramento de KPIs e suporte à tomada de decisão.
Metodologias e Infraestrutura: Gestão de projetos sob o framework Scrum e experiência com arquitetura em nuvem e fundamentos de computação em nuvem.
Objetivo: Conectar tecnologia de ponta e rigor estatístico para resolver problemas complexos de negócio, garantindo a integridade dos dados e a geração de valor mensurável.
- Análise de Dados
- Engenharia de Dados
- Bancos de Dados
- Ciência de Dados
Engenharia de Dados ponta a ponta com arquitetura Medalhão em Databricks
Pipeline completo de dados públicos da PRF com arquitetura Medalhão (Bronze → Silver → Gold) em PySpark e Delta Lake no Databricks. Processa 72.524 registros com transformações distribuídas, particionamento, transações ACID e entrega analítica via dashboard Databricks SQL — do CSV bruto ao insight em ~2 minutos.
Destaques técnicos: arquitetura Medalhão, Delta Lake com versionamento ACID, orquestração via dbutils.notebook.run() (padrão Airflow-ready), 4 tabelas Gold com métricas derivadas e dashboard publicado.
PySpark Delta Lake Databricks Arquitetura Medalhão ETL Python SQL Big Data Data Engineering
Link: https://github.com/joaohppenha/projeto-acidentes-prf
Pipeline de dados orientado a eventos para espelhamento tributário em tempo real, simulando o impacto da Reforma Tributária Brasileira (IBS/CBS) via Shadow Accounting.
Destaques técnicos: Apache Airflow, Amazon SQS, S3, AWS Glue Catalog, Parquet, Amazon Athena, Streamlit. Dashboard executivo para CFO com KPIs de delta tributário e riscos de precificação.
Airflow AWS SQS S3 Athena Streamlit Parquet Python Compliance Data Engineering
Link: https://github.com/joaohppenha/shadow-tax-ledger
Sistema de predição de desfechos judiciais e provisionamento financeiro com Random Forest. Integra ETL de múltiplas fontes, análise estatística e dashboards Power BI. Gerou aumento de até 50% na eficiência da gestão de processos.
Random Forest Python Power BI ETL Web Scraping SQL NoSQL Machine Learning
Link: https://github.com/joaohppenha/jurimetria_preditiva
Sistema completo de empréstimo consignado utilizando MongoDB, Redis e Cassandra. Inclui modelagem, CRUD, consultas avançadas, cache, otimizações de performance e execução via Docker.
MongoDB Redis Cassandra Docker Jupyter NoSQL Python
Link: https://github.com/joaohppenha/projeto-banco-de-emprestimo-consignado
Análise descritiva do cenário de acessibilidade física dos cinemas brasileiros com dados da ANCINE. Uso de Power Query, DAX, gráficos, mapas e storytelling com dados.
Power BI Power Query DAX Data Visualization Open Data
Link: https://github.com/joaohppenha/projeto_acessibilidade_nos_cinemas
Modelagem e implementação de banco de dados relacional para escritório de advocacia em MySQL. Aplicativo CLI em Python para gestão jurídica e geração automática de preâmbulos de petições.
MySQL Python SQL mysql-connector-python CLI
Link: https://github.com/joaohppenha/projeto-jurisconsulto
Pipeline ETL em Python sobre dados públicos do Supremo Tribunal Federal: extração de planilhas Excel, limpeza, transformação e visualização de dados.
Python Pandas ETL Excel Data Visualization Git
Link: https://github.com/joaohppenha/projeto-STF
- Fundamentos SQL — DDL, DML, DQL, DTL, DCL com BigQuery → github.com/joaohppenha/fundamentos-sql
- Fundamentos Python — 5 projetos cobrindo variáveis, estruturas de controle, listas, funções, arquivos e exceções → github.com/joaohppenha/fundamentos-python
- ⚙️ Engenharia de Dados · Pipelines ETL/ELT · Arquitetura de Dados
- 📊 Análise de Dados · Ciência de Dados · Machine Learning
- ⚖️ Jurimetria · Legal Analytics · Dados Jurídicos
- 🗄️ Bancos de Dados SQL e NoSQL · Data Modeling
- 📈 Business Intelligence · Dashboards · Data Storytelling
- ☁️ Cloud Data Platforms · Databricks · BigQuery · AWS · Azure
🇺🇸 English
I'm a Data Analyst and Jurimetrics Specialist focused on building predictive solutions and optimizing data infrastructure. My work combines Data Science, Engineering, and Business Intelligence to transform large volumes of information into strategic assets and reduce financial liabilities.
Technical Expertise:
Data Science & Jurimetrics: Stochastic modeling with Random Forest for risk prediction and dynamic financial provisioning of legal cases.
Data Engineering: Pipeline development, Databricks, Cloud, Apache Airflow orchestration, Spark processing, ETL, and SQL/NoSQL database management (Redis, Cassandra, MongoDB), with a focus on scalability and low latency.
Business Intelligence: Executive dashboards in Streamlit and Power BI for KPI monitoring and decision support.
Methodologies & Infrastructure: Project management under the Scrum framework, cloud architecture, and cloud computing fundamentals.
Objective: Connecting cutting-edge technology and statistical rigor to solve complex business problems, ensuring data integrity and measurable value generation.
- Data Analysis
- Data Engineering
- Databases
- Data Science
End-to-end Data Engineering with Medallion Architecture on Databricks
Complete pipeline for public PRF data using Medallion Architecture (Bronze → Silver → Gold) with PySpark and Delta Lake on Databricks. Processes 72,524 records with distributed transformations, partitioning, ACID transactions, and analytical delivery via Databricks SQL dashboard — from raw CSV to insight in ~2 minutes.
Technical highlights: Medallion architecture, Delta Lake with ACID versioning, orchestration via dbutils.notebook.run() (Airflow-ready pattern), 4 Gold tables with derived metrics, and published dashboard.
PySpark Delta Lake Databricks Medallion Architecture ETL Python SQL Big Data Data Engineering
Link: https://github.com/joaohppenha/projeto-acidentes-prf
Event-driven data pipeline for real-time tax mirroring, simulating the impact of Brazil's Tax Reform (IBS/CBS) via Shadow Accounting.
Technical highlights: Apache Airflow, Amazon SQS, S3, AWS Glue Catalog, Parquet, Amazon Athena, Streamlit. Executive dashboard for CFO with tax delta KPIs and pricing risk exposure.
Airflow AWS SQS S3 Athena Streamlit Parquet Python Compliance Data Engineering
Link: https://github.com/joaohppenha/shadow-tax-ledger
Judicial outcome prediction system and dynamic financial provisioning using Random Forest. Integrates ETL from multiple sources, statistical analysis, and Power BI dashboards. Delivered up to 50% improvement in case management efficiency.
Random Forest Python Power BI ETL Web Scraping SQL NoSQL Machine Learning
Link: https://github.com/joaohppenha/jurimetria_preditiva
Complete payroll loan system using MongoDB, Redis, and Cassandra. Includes data modeling, CRUD, advanced queries, caching, performance optimizations, and a reproducible Docker environment.
MongoDB Redis Cassandra Docker Jupyter NoSQL Python
Link: https://github.com/joaohppenha/projeto-banco-de-emprestimo-consignado
Descriptive analysis of the physical accessibility landscape of Brazilian cinemas using ANCINE open data. Includes Power Query, DAX formulas, charts, maps, and data storytelling.
Power BI Power Query DAX Data Visualization Open Data
Link: https://github.com/joaohppenha/projeto_acessibilidade_nos_cinemas
Relational database modeling and implementation for a law firm in MySQL. Python CLI application for legal case management and automatic generation of legal petition headers.
MySQL Python SQL mysql-connector-python CLI
Link: https://github.com/joaohppenha/projeto-jurisconsulto
Python ETL pipeline on public data from Brazil's Supreme Court: extraction from Excel spreadsheets, cleaning, transformation, and data visualization.
Python Pandas ETL Excel Data Visualization Git
Link: https://github.com/joaohppenha/projeto-STF
- SQL Fundamentals — DDL, DML, DQL, DTL, DCL with BigQuery → github.com/joaohppenha/fundamentos-sql
- Python Fundamentals — 5 projects covering variables, control flow, lists, functions, files, and exceptions → github.com/joaohppenha/fundamentos-python
- ⚙️ Data Engineering · ETL/ELT Pipelines · Data Architecture
- 📊 Data Analysis · Data Science · Machine Learning
- ⚖️ Jurimetrics · Legal Analytics · Legal Data
- 🗄️ SQL & NoSQL Databases · Data Modeling
- 📈 Business Intelligence · Dashboards · Data Storytelling
- ☁️ Cloud Data Platforms · Databricks · BigQuery · AWS · Azure
PT: Conectando tecnologia de ponta e rigor estatístico para resolver problemas complexos de negócio.
EN: Connecting cutting-edge technology and statistical rigor to solve complex business problems.
LinkedIn: https://www.linkedin.com/in/jhppenha/