
ITDS Portugal
Engenheiro de Confiabilidade do Site – Infraestrutura em Nuvem
21 de agosto de 2026
Capacitar a Resiliência na Nuvem — Impulsione a Inovação e a Confiabilidade em Grande Escala!
Esta é uma oportunidade com sede em Portugal e com uma estrutura de trabalho totalmente remota (até 5 dias por semana).
Como Engenheiro de Confiabilidade do Site (AWS), você será responsável pela confiabilidade, escalabilidade e saúde operacional da plataforma baseada em AWS do nosso cliente — um líder no domínio da nuvem e infraestrutura. Este é um papel de engenharia prático com uma mentalidade de sistemas: você definirá e defenderá SLOs, reduzirá o esforço através da automação, liderará a resposta a incidentes, e criará as ferramentas e a infraestrutura como código que permitem que as equipas de desenvolvimento entreguem de forma segura e rápida.
As suas principais responsabilidades:
- Definir, medir e aplicar SLOs, SLIs e orçamentos de erro, e usá-los para direcionar prioridades de engenharia e decisões de lançamento.
- Gerir o ciclo de vida de incidentes — deteção, resposta, mitigação e post-mortems sem culpa — reduzindo o tempo médio de recuperação através de melhores ferramentas e runbooks.
- Projetar e manter arquiteturas AWS altamente disponíveis e tolerantes a falhas em computação, redes, armazenamento e camadas de dados.
- Criar e manter infraestrutura como código e pipelines CI/CD que tornem as implantações repetíveis, auditáveis e de baixo risco.
- Identificar e eliminar sistematicamente o esforço através da automação, substituindo o trabalho operacional manual por sistemas auto-corrigíveis.
- Gerir a observabilidade — métricas, logging, rastreamento, alertas — para que os problemas apareçam antes de chegarem aos clientes.
- Colaborar com equipas de desenvolvimento em planeamento de capacidade, ajuste de desempenho, otimização de custos e avaliações de prontidão para produção.
- Melhorar a segurança e a conformidade do ambiente de nuvem em colaboração com equipas de segurança.
- Participar e melhorar a rotação de plantão, ajustando alertas para reduzir ruído e fadiga.
Você é ideal para este papel se tiver:
- Experiência sólida em produção com sistemas operacionais em grande escala na AWS, incluindo serviços centrais (EC2, ECS/EKS, Lambda, VPC, IAM, S3, RDS, CloudWatch).
- Boa base nos princípios de SRE — SLOs, orçamentos de erro, redução de esforço, post-mortems sem culpa.
- Experiência prática com infraestrutura como código (Terraform preferido; CloudFormation ou CDK aceitável).
- Proficiência com orquestração de contêineres (Kubernetes / EKS) e ferramentas CI/CD.
- Fortes habilidades de scripting e automação em pelo menos uma linguagem (Python, Go ou Bash).
- Experiência profunda com stacks de observabilidade (Prometheus, Grafana, Datadog, ELK ou equivalentes).
- Propriedade demonstrada da resposta a incidentes e plantão em um ambiente de produção.
- Sólido entendimento de redes, internos do Linux e modos de falha de sistemas distribuídos.
Boa ter (não obrigatório):
- Certificações AWS (Arquiteto de Soluções, Engenheiro DevOps ou SysOps).
- Experiência com configurações AWS multi-conta / multi-região e governança de custos.
- Experiência em engenharia de caos ou teste de resiliência.
- Service mesh, GitOps (ArgoCD / Flux) ou policy-as-code (OPA).
- Experiência em indústrias regulamentadas (serviços financeiros, saúde).
Idioma: Inglês fluente
Elegibilidade:
- Apenas candidatos com o direito legal de trabalhar em Portugal ou na União Europeia serão considerados.
- Apenas candidatos com sede em Portugal serão considerados.
#FAÇASeuCarreiraMelhor
Interessado? Candidate-se agora e inclua o seu CV (preferencialmente em inglês) juntamente com uma declaração confirmando o seu consentimento para o processamento e armazenamento dos seus dados pessoais.