CAPGov, Public Data Platform
Pipelines de ETL transformando grandes bases públicas em evidência que pesquisadores de políticas podem citar.
O registro
- Papel
- Iniciação científica em ETL
- Ano
- 2023 – 2026
- Stack
- Python
- SQL
- Docker
- ETL
- Prova
- dashboards analíticos em uso
Visão geral
Três anos construindo a infraestrutura de dados por trás de pesquisa de políticas baseada em evidência: pipelines que ingerem grandes bases públicas, validam e entregam os dados em um lugar em que analistas podem confiar.
O que construí
- Construí os pipelines de ETL em Python e SQL que ingerem e processam as grandes bases públicas por trás da pesquisa do grupo.
- Levei uma infraestrutura legada para serviços containerizados com Docker, de modo que um pesquisador sobe o ambiente com um comando e o desenvolvimento espelha a produção.
- Troquei a entrada manual de dados por validação na ingestão, para que uma linha ruim seja barrada antes de chegar a um dashboard analítico, e não depois de alguém já ter citado o número.