← voltar para vagas
sre - infraestrutura e confiabilidade
Sobre a vaga
Buscamos uma pessoa para o time de plataforma, responsável por manter nossos serviços no Google Cloud Platform (GCP) confiáveis e escaláveis. Você vai trabalhar com Cloud Run, Cloud SQL, GCS e ferramentas de observabilidade como Grafana, Prometheus, Zabbix e Datadog.
Responsabilidades
- Garantir a disponibilidade e performance dos serviços em produção.
- Implementar e manter monitoramento, alertas e dashboards.
- Automatizar tarefas de infraestrutura com Terraform e scripts em Python/Bash.
- Colaborar com os times de desenvolvimento para melhorar a confiabilidade e a observabilidade das aplicações.
- Participar de plantões de suporte e responder a incidentes.
Requisitos
- Experiência com GCP (Cloud Run, Cloud SQL, GCS).
- Conhecimento em ferramentas de observabilidade (Grafana, Prometheus, Datadog, Zabbix).
- Familiaridade com Docker e Terraform.
- Habilidade em automação com Python ou Bash.
- Conhecimento em PostgreSQL.
- Inglês intermediário para comunicação com times globais.
Diferenciais
- Experiência com TypeScript, Node.js, React, Apollo Server ou Express.
- Conhecimento em práticas de SRE (SLOs, error budgets, blameless postmortems).
Benefícios
- Remoto para América do Norte e do Sul.
- Horário flexível.
- Ambiente colaborativo e focado em aprendizado.