SLA em Sistemas: O Que É e Como Calcular
SLA em sistemas é o acordo que define o nível de serviço esperado, como disponibilidade e tempo de resposta. Calcular corretamente exige fórmula, janela de medição e exclusões bem definidas. Veja como aplicar no seu contexto.
SLA em sistemas é o acordo que define o nível de serviço esperado, como disponibilidade e tempo de resposta. Calcular corretamente exige fórmula, janela de medição e exclusões bem definidas. Veja como aplicar no seu contexto.
O que é SLA em sistemas e como calcular?
SLA (Service Level Agreement) é um acordo formal que define o nível de serviço esperado entre um provedor e um cliente. Em sistemas, ele especifica métricas como disponibilidade, tempo de resposta e tempo de resolução. Para calcular, usamos fórmulas como disponibilidade = (tempo total - tempo de indisponibilidade) / tempo total × 100, ou SLA% = (solicitações dentro do prazo / total de solicitações) × 100. O cálculo correto exige definir a janela de medição, as exclusões e a métrica exata.
Qual a diferença entre SLA, SLO e SLI?
SLA é o contrato com o cliente, com consequências pelo descumprimento. SLO é a meta interna que a equipe se compromete a atingir. SLI é a métrica real medida. Por exemplo, um SLI de disponibilidade pode ser 99,95%, o SLO interno pode ser 99,99%, e o SLA contratual pode ser 99,9%. A distinção importa porque o SLO precisa ser mais rigoroso que o SLA para dar margem de manobra. Sem essa separação, a equipe trabalha no limite e qualquer incidente vira quebra de contrato.
Como calcular a disponibilidade de um sistema?
A disponibilidade é a proporção do tempo em que o sistema está operacional dentro de uma janela. A fórmula é: disponibilidade = (tempo total - tempo de indisponibilidade) / tempo total × 100. Se um sistema fica fora do ar por 43 minutos em um mês de 30 dias (43.200 minutos), a disponibilidade é (43.200 - 43) / 43.200 × 100 = 99,9%. Esse valor é o famoso "três noves". Para 99,99% (quatro noves), o downtime mensal permitido cai para cerca de 4,3 minutos. A escolha do número de noves tem custo exponencial: cada nove adicional exige redundância, monitoramento e processos mais caros.
Como calcular o SLA de atendimento?
Para atendimento, a fórmula comum é: SLA% = (solicitações atendidas dentro do prazo ÷ total de solicitações recebidas) × 100. Se um service desk recebe 500 tickets e resolve 450 dentro do prazo acordado, o SLA é 90%. O prazo pode ser definido por prioridade: crítico em 1 hora, alto em 4 horas, médio em 8 horas. O cálculo deve considerar apenas tickets elegíveis, excluindo os que estão aguardando o cliente ou fora do horário comercial, se isso estiver previsto no acordo. Sem essas exclusões, o número fica distorcido e não reflete a realidade operacional.
Quais métricas incluir em um SLA de sistemas?
Além de disponibilidade e tempo de atendimento, um SLA robusto costuma incluir:
- Latência de resposta: tempo para a API responder a uma requisição, geralmente medido em percentis (p95, p99).
- Taxa de erro: percentual de requisições que falham, como HTTP 5xx.
- Throughput: capacidade de processar transações por segundo.
- Tempo de recuperação (RTO): tempo máximo para restaurar o serviço após uma falha.
- Ponto de recuperação (RPO): perda máxima de dados aceitável, medida em tempo.
Cada métrica precisa de uma definição precisa. "Latência" sem qualificar o percentil e a janela de medição é inútil. O mesmo vale para "disponibilidade": um sistema pode estar de pé mas inacessível para parte dos usuários. Por isso, o SLI deve ser medido do ponto de vista do cliente, não apenas do servidor.
Como definir a janela de medição e as exclusões?
A janela de medição é o período sobre o qual o SLA é calculado: mensal, trimestral ou anual. A escolha afeta o resultado. Um downtime de 1 hora em um mês de 30 dias representa 0,14% do tempo; no ano, representa 0,011%. Exclusões típicas incluem manutenções programadas com aviso prévio, falhas causadas pelo cliente e eventos de força maior. Essas exclusões precisam estar escritas no contrato. Sem elas, qualquer manutenção vira quebra de SLA e gera créditos ou penalidades.
Erros comuns ao calcular SLA
Um erro frequente é medir a disponibilidade apenas no servidor, ignorando a experiência do usuário. Outro é definir metas sem baseline: se você não sabe qual é a disponibilidade atual, qualquer número é chute. Também é comum esquecer de monitorar o SLI continuamente; sem dados históricos, não há como provar o cumprimento. Por fim, tratar o SLA como meta interna e não como contrato leva a conflitos quando o cliente cobra o resultado.
Resumo prático
SLA é um acordo mensurável. Calcular exige fórmula clara, janela definida e exclusões explícitas. Separe SLA, SLO e SLI para dar margem à operação. Meça do ponto de vista do cliente e monitore continuamente.
FAQ
O que significa SLA em sistemas?
SLA é o acordo que define o nível de serviço esperado, incluindo métricas como disponibilidade, tempo de resposta e tempo de resolução. É um compromisso formal entre provedor e cliente, com consequências pelo descumprimento.
Como calcular o SLA de disponibilidade?
Use a fórmula: disponibilidade = (tempo total - tempo de indisponibilidade) / tempo total × 100. Defina a janela (mensal, anual) e considere apenas indisponibilidades que afetam o serviço conforme o contrato.
Qual a diferença entre SLA e SLO?
SLA é o contrato com o cliente, com penalidades. SLO é a meta interna da equipe, geralmente mais rigorosa que o SLA para dar margem de manobra. O SLO não tem consequência contratual direta.
Como calcular SLA de atendimento?
SLA% = (solicitações atendidas dentro do prazo ÷ total de solicitações) × 100. Defina prazos por prioridade e exclua tickets fora do escopo, como os aguardando resposta do cliente.
O que é um SLI?
SLI é a métrica real medida, como disponibilidade ou latência. É a base para verificar se o SLO e o SLA estão sendo cumpridos. Sem SLI, não há como provar o nível de serviço.
Quantos noves de disponibilidade devo contratar?
Depende do custo e da criticidade. 99,9% (três noves) permite cerca de 43 minutos de downtime mensal; 99,99% (quatro noves) reduz para cerca de 4,3 minutos. Cada nove adicional aumenta exponencialmente o custo de infraestrutura e processos.
Ivan Krause Montenegro
Editor de Desenvolvimento e Software
Programador de carreira, escreve sobre código e dev para quem programa de verdade.
Ver todos os artigos →