SRE, SLOs e Error Budgets: como Google pensa sobre confiabilidade
SRE (Site Reliability Engineering) não é um cargo — é uma disciplina. SLOs e Error Budgets são as ferramentas que permitem ao time equilibrar velocidade de entrega e confiabilidade de forma objetiva.
O problema que SRE resolve
A tensão clássica entre desenvolvimento e operação: dev quer entregar features rápido, ops quer estabilidade. Sem um framework comum, esse conflito vira politicagem. SRE resolve isso com uma linguagem matemática compartilhada: SLIs, SLOs e Error Budgets.
SLI, SLO e SLA: as definições que importam
- SLI (Service Level Indicator) — a métrica que você está medindo: disponibilidade, latência, taxa de erro.
- SLO (Service Level Objective) — o objetivo interno: "99.9% de disponibilidade no percentil 95 de latência abaixo de 200ms".
- SLA (Service Level Agreement) — o compromisso contratual com o cliente. Sempre mais conservador do que o SLO interno.
Error Budget: a ferramenta que muda a dinâmica
Se o SLO é 99.9% de disponibilidade, o Error Budget mensal é 0.1% do tempo — cerca de 43 minutos. Quando o time está dentro do budget, pode fazer deploys agressivos. Quando o budget está se esgotando, deve desacelerar e investir em confiabilidade. Essa mecânica alinha os incentivos de dev e ops objetivamente.
Como implementar SLOs na prática
- Identificar os journeys críticos do usuário e as métricas que medem sua qualidade.
- Definir SLOs baseados em impacto de negócio, não em capacidade técnica.
- Instrumentar a medição dos SLIs com alertas de burn rate.
- Criar o processo de revisão de Error Budget e decisão de desacelerar quando necessário.
Próximo passo
Quer estruturar SLOs e Error Budgets para o seu produto?
A rune.dev implementa práticas de SRE com foco em confiabilidade operacional e alinhamento com objetivos de negócio.
Falar com um especialista →Precisa de apoio técnico no seu ambiente?
Diagnóstico sem compromisso. Retorno em até 48h úteis.