Última atualização: 23 de Setembro de 2026
Pessoa Engenheira de Dados Júnior
Atuação em banco digital com PySpark, AWS e IA
Via Inhire
Sobre
Buscamos uma Pessoa Engenheira de Dados Júnior para atuar dedicada em um banco digital de grande porte, em plena expansão, contribuindo na construção e na evolução de pipelines de dados que sustentam produtos, análises e modelos de negócio do banco. Você fará parte de um time de plataforma de dados em ambiente AWS, participando do ciclo completo dos dados — da ingestão e transformação em PySpark à disponibilização em camadas de Data Lake / Lakehouse — com acompanhamento de pessoas engenheiras sêniores, exposição a arquitetura moderna de dados em escala e uso de IA aplicada ao dia a dia de engenharia. É uma posição de crescimento, com espaço para aprender, assumir responsabilidades gradualmente e evoluir tecnicamente.
Responsabilidades
- Desenvolver e manter pipelines de dados em Python / PySpark, seguindo padrões definidos pelo time.
- Escrever e ajustar consultas SQL para extração, transformação e validação de dados.
- Apoiar a ingestão de dados de diferentes fontes (bancos relacionais, APIs, eventos) para o Data Lake em AWS (S3, Glue, Athena, EMR).
- Participar da construção e manutenção de DAGs de orquestração no Airflow, sob orientação técnica.
- Aplicar boas práticas de modelagem em arquitetura medalhão (bronze, prata, ouro) e formatos colunares (Parquet / Delta).
- Implementar validações e checagens de qualidade de dados, documentando regras e resultados.
- Utilizar Git e a esteira de CI/CD para versionamento, revisão (code review) e deploy dos pipelines.
- Apoiar o monitoramento dos pipelines em produção, identificando falhas e ajudando na correção.
- Participar de cerimônias ágeis, refinamento de demandas e estimativas junto ao time.
- Utilizar ferramentas de IA aplicadas ao desenvolvimento (GitHub Copilot, Claude Code ou similares) para acelerar codificação, testes e documentação, com senso crítico sobre o resultado gerado.
Requisitos
- Experiência prática em Python aplicado a dados, ainda que em projetos de menor porte, estágio ou acadêmicos
- Conhecimento de SQL: joins, agregações, CTEs e funções de janela
- Noções de Apache Spark / PySpark (DataFrames, transformações e ações)
- Familiaridade com conceitos de Data Lake, Data Warehouse e Lakehouse
- Familiaridade com Git e fluxo de branches / pull requests
- Noções de serviços de dados em nuvem, preferencialmente AWS (S3, Glue, Athena ou EMR)
- Vivência ou interesse em metodologias ágeis (Scrum/Kanban)
- Formação em andamento ou concluída em Ciência da Computação, Engenharia, Sistemas de Informação, Estatística, Análise e Desenvolvimento de Sistemas ou áreas correlatas
Desejáveis
- Experiência ou estágio no setor financeiro, bancário ou fintech
- Contato com Airflow ou outra ferramenta de orquestração
- Noções de Kafka ou outras plataformas de streaming de dados
- Contato com Docker, Kubernetes ou Terraform
- Conhecimento de Trino / Presto ou Databricks
- Noções de qualidade de dados, testes de pipeline e observabilidade
- Certificações em AWS ou Databricks (Cloud Practitioner, Data Engineer Associate ou similares)
- Uso de ferramentas de IA no fluxo de desenvolvimento
- Inglês para leitura de documentação técnica
Benefícios
- Vale Alimentação e/ou Vale Refeição
- Convênio Sesi e Sesc, oferecendo acesso a serviços de saúde, bem-estar e lazer
- Parceria com Instituições de Ensino, com descontos exclusivos em cursos e programas educacionais
- Auxílio para Certificações
- Possibilidade de crescimento na empresa e de participação em projetos estratégicos
Outras Informações
Selecionamos as principais informações da posição. Para conferir o descritivo completo, clique em "acessar"
Hey!
Cadastre-se na Remotar para ter acesso a todos os recursos da plataforma, inclusive inscrever-se em vagas exclusivas e selecionadas!