Especialista de Engenharia de Dados I
Experian · São Paulo, br
onsitefull-time3-6 years
posted 1d
Responsável por transformar modelos analíticos em sistemas confiáveis, observáveis e escaláveis , desde o pipeline de features até o monitoramento em produção. Atuará como referência técnica dentro do time, em parceria próxima com Cientistas de Dados, Engenheiros de Dados, Arquitetura e Produto, ajudando a elevar o padrão de engenharia de ML da companhia.   Principais responsabilidades: - Projetar, construir e manter pipelines de ML end-to-end (treinamento, validação, deploy e retreinamento) com automação e reprodutibilidade. - Colocar modelos em produção em escala, em modos batch, near-real-time e online (baixa latência). - Desenvolver e evoluir a plataforma de ML interna: feature store, model registry, versionamento de dados e modelos, orquestração e ambientes de experimentação. - Implementar observabilidade de modelos: monitoramento de performance, data drift, concept drift, qualidade de dados, alertas e planos de resposta. - Construir e manter CI/CD para ML, incluindo testes automatizados de dados, features e modelos, além de estratégias de rollout (canary, shadow, blue-green, A/B). - Garantir confiabilidade e eficiência dos serviços de inferência: SLAs, escalabilidade, custo por inferência e otimização de recursos. - Atuar junto à Ciência de Dados para tornar experimentos produtizáveis, reduzindo o tempo entre ideia e valor em produção. - Assegurar governança, rastreabilidade e conformidade dos modelos com as políticas internas, LGPD e requisitos regulatórios do setor de crédito. - Definir e disseminar boas práticas de engenharia de ML: code review, documentação, padrões de arquitetura e mentoria técnica do time. - Contribuir com decisões de arquitetura e com a evolução do roadmap técnico da área.   Conhecimentos técnicos essenciais: - Python em nível avançado, com boas práticas de engenharia (testes, tipagem, empacotamento, code review). - SQL avançado e experiência com processamento distribuído (Spark, PySpark ou equivalente). - Cloud (AWS, GCP ou Azure), com foco em serviços de dados e ML. - Containers e orquestração: Docker e Kubernetes. - Orquestração de pipelines: Airflow, Kubeflow, Dagster, Step Functions ou similares. - Ferramentas de MLOps: MLflow, SageMaker, Vertex AI, Databricks, Feast ou equivalentes. - Infraestrutura como código (Terraform) e práticas de CI/CD (GitHub Actions, GitLab CI, Jenkins). - Fundamentos de machine learning suficientes para dialogar com Ciência de Dados: métricas de avaliação, validação, causas de degradação de modelos. - APIs e serviços de inferência: FastAPI, gRPC, filas e streaming (Kafka, Kinesis). - Monitoramento e observabilidade: Prometheus, Grafana, Datadog, Evidently ou similares.  -  Experiência sólida em engenharia de software e/ou engenharia de machine learning, com histórico comprovado de modelos em produção.  - Vivência em ambientes de alto volume de dados e requisitos de disponibilidade.   Competências comportamentais: - Autonomia e capacidade de conduzir problemas ambíguos até uma solução clara. - Comunicação eficaz com públicos técnicos e não técnicos. - Postura colaborativa e disposição para compartilhar conhecimento e desenvolver pessoas. - Pragmatismo: equilíbrio entre rigor técnico e entrega de valor.   Será um diferencial:  - Experiência no setor financeiro, de crédito, risco ou prevenção a fraudes. - Vivência com modelos regulados e requisitos de explicabilidade e auditoria. - Experiência com LLMs e GenAI em produção: RAG, avaliação, guardrails e otimização de custo de inferência. - Contribuições para projetos open source, publicações técnicas ou palestras. - Experiência com otimização de inferência (quantização, ONNX, Triton) ou processamento em streaming. - Inglês ou espanhol para colaboração com times globais.