Publicidade

Última atualização: 23 de Setembro de 2026

Pessoa Engenheira de Dados Júnior

Atuação em banco digital com PySpark, AWS e IA

🐥 Júnior🐣 Estágio🌍 100% Remoto

Via Inhire

Sobre

Buscamos uma Pessoa Engenheira de Dados Júnior para atuar dedicada em um banco digital de grande porte, em plena expansão, contribuindo na construção e na evolução de pipelines de dados que sustentam produtos, análises e modelos de negócio do banco. Você fará parte de um time de plataforma de dados em ambiente AWS, participando do ciclo completo dos dados — da ingestão e transformação em PySpark à disponibilização em camadas de Data Lake / Lakehouse — com acompanhamento de pessoas engenheiras sêniores, exposição a arquitetura moderna de dados em escala e uso de IA aplicada ao dia a dia de engenharia. É uma posição de crescimento, com espaço para aprender, assumir responsabilidades gradualmente e evoluir tecnicamente.

Responsabilidades

  • Desenvolver e manter pipelines de dados em Python / PySpark, seguindo padrões definidos pelo time.
  • Escrever e ajustar consultas SQL para extração, transformação e validação de dados.
  • Apoiar a ingestão de dados de diferentes fontes (bancos relacionais, APIs, eventos) para o Data Lake em AWS (S3, Glue, Athena, EMR).
  • Participar da construção e manutenção de DAGs de orquestração no Airflow, sob orientação técnica.
  • Aplicar boas práticas de modelagem em arquitetura medalhão (bronze, prata, ouro) e formatos colunares (Parquet / Delta).
  • Implementar validações e checagens de qualidade de dados, documentando regras e resultados.
  • Utilizar Git e a esteira de CI/CD para versionamento, revisão (code review) e deploy dos pipelines.
  • Apoiar o monitoramento dos pipelines em produção, identificando falhas e ajudando na correção.
  • Participar de cerimônias ágeis, refinamento de demandas e estimativas junto ao time.
  • Utilizar ferramentas de IA aplicadas ao desenvolvimento (GitHub Copilot, Claude Code ou similares) para acelerar codificação, testes e documentação, com senso crítico sobre o resultado gerado.

Requisitos

  • Experiência prática em Python aplicado a dados, ainda que em projetos de menor porte, estágio ou acadêmicos
  • Conhecimento de SQL: joins, agregações, CTEs e funções de janela
  • Noções de Apache Spark / PySpark (DataFrames, transformações e ações)
  • Familiaridade com conceitos de Data Lake, Data Warehouse e Lakehouse
  • Familiaridade com Git e fluxo de branches / pull requests
  • Noções de serviços de dados em nuvem, preferencialmente AWS (S3, Glue, Athena ou EMR)
  • Vivência ou interesse em metodologias ágeis (Scrum/Kanban)
  • Formação em andamento ou concluída em Ciência da Computação, Engenharia, Sistemas de Informação, Estatística, Análise e Desenvolvimento de Sistemas ou áreas correlatas

Desejáveis

  • Experiência ou estágio no setor financeiro, bancário ou fintech
  • Contato com Airflow ou outra ferramenta de orquestração
  • Noções de Kafka ou outras plataformas de streaming de dados
  • Contato com Docker, Kubernetes ou Terraform
  • Conhecimento de Trino / Presto ou Databricks
  • Noções de qualidade de dados, testes de pipeline e observabilidade
  • Certificações em AWS ou Databricks (Cloud Practitioner, Data Engineer Associate ou similares)
  • Uso de ferramentas de IA no fluxo de desenvolvimento
  • Inglês para leitura de documentação técnica

Benefícios

  • Vale Alimentação e/ou Vale Refeição
  • Convênio Sesi e Sesc, oferecendo acesso a serviços de saúde, bem-estar e lazer
  • Parceria com Instituições de Ensino, com descontos exclusivos em cursos e programas educacionais
  • Auxílio para Certificações
  • Possibilidade de crescimento na empresa e de participação em projetos estratégicos

Outras Informações

Selecionamos as principais informações da posição. Para conferir o descritivo completo, clique em "acessar"

Hey!

Cadastre-se na Remotar para ter acesso a todos os recursos da plataforma, inclusive inscrever-se em vagas exclusivas e selecionadas!