Planejamento de turnos
1) Objetivos e marcos
O planejamento dos turnos permite que a plataforma esteja sempre pronta para incidentes e picos de tráfego sem queimar comandos. Objetivos:- garantir a cobertura de processos SLO-criteriosos (depósitos, taxas/setl, conclusões, KYC/AML);
- reduzir o MTTA/MTTR a qualquer hora do dia;
- respeitar as leis trabalhistas e políticas internas (fim de semana/intervalo/noite).
2) Papéis e níveis de suporte
L1 (NOC/Operations): triagem primária, arranque runbook, escalação.
L2 (Domain On-Call): Payments, Games/Core, Data/Infra - diagnóstico profundo e fixação.
L3 (SRE/Plataforma/Dave): alterações de configuração, patches, lançamentos de emergência.
IC/CL (Invent Commer/Comms Lead): gerencia o incidente e as comunicações.
Duty Gerente (por mudança): confirma staffing, riscos, janelas freeze.
3) Modelos de turnos e rotações
3. 1 24 x 7 revestimento
8 x 3 (três horas): Day (08: 00-16: 00), Swing (16: 00-00: 00), Night (00: 00-08: 00). Fácil de gerenciar, requer mais funcionários.
12 x 2 (duas 12h): Day (08: 00-20: 00), Night (20: 00-08: 00). Menos hendowers, mais risco de cansaço - usar com restrições.
Follow-the-sun: EU → AMER → APAC, mínimo noturno; requer um comando distribuído.
3. 2 Modelos de rotação (exemplo)
Panama/Pitman (2-2, 3-2, 2-3): Alternância de 12 horas com fim de semana prolongado (requer controle rigoroso do cansaço).
4-on/4-off (12h): 4 dias a 12 horas, 4 dias de folga; adequado para L1 com boa automação.
5 x 8 (clássico): para L2/L3 + serviço on-call noite/fim de semana.
3. 3 Vigias on-call
Primary/Segundary: Cada domínio tem um on-call primário e secundário.
Shadow-on-call: Treinamento de novos engenheiros sob a ala Primary.
4) Cálculo do estado e «retirada» (shrinkage)
4. 1 Fórmula base FTE
Os FTE necessários para o papel:
FTE = (coverage hours per week/productive FTE hours per week) × (1 + shrinkage)
Onde a shinkage inclui férias/hospital/treinamento/1: 1/retro/admin-time (normalmente 20-35%).
Exemplo (L1 24 x 7, 8 horas):- 168 h de cobertura/35 horas produtivas/ned ≈ 4. 8
- Com shrinkage 30% → 4. 8 × 1. 3 ≈ 6. 2 FTE (arredondando para 7 para estabilidade).
4. 2 Plano de picos
Adicione o coeficiente de pico para eventos (jogos top, torneios): + 10-25% FTE nas janelas de calendário. Use gráficos históricos de alertas/tráfego.
5) Revestimento SLO e janelas de risco
Execute a matriz de relógios críticos («horário nobre» local GEO/métodos de pagamento).
Defina a composição mínima em slot (por exemplo, Night: L1 x 2, L2-Payments x 1 on-call, L2-Games x 1 on-call, IC rotativo).
Para lançamentos/migrações, atribua release guard (extra L2/SRE) para o período e + 60 min pós-monitorização.
6) Hendowers (transferência de turno)
Estrutura de 10-15 minutos:1. Status SLO/alertas e incidentes abertos.
2. Trabalho programado na janela + riscos.
3. Bloqueadores/espera (provedores PSP/KYC, regulamento).
4. Planos compatíveis (status-página, parceiros).
5. Verificar a composição do turno e os contatos on-call.
A folha de cheque hendover deve estar no wiki/bot; O protocolo está na sala de war ou no canal de mudança.
7) Calendário e substituições
Horizonte de planejamento: 8 a 12 semanas; substituição - no máximo 2 semanas (exceto força maior).
Período Freeze: grandes eventos/feriados - proibição de férias para papéis-chave (compensado mais tarde).
Buddy-rule: substitui-lo apenas por um engenheiro do mesmo domínio/qualificação ou com mais shadow.
8) Integração com plataforma
Alerting: rotação em turnos ativos e domínios (P1→pager+var).
Incidente-bot: comandos de '/rota ', '/whoisoncall', menção automática IC/CL.
Lançamentos: FAB sincronizado com o horário dos turnos; lançamentos fora da cobertura são proibidos.
O status da página CL do turno ativo está confirmado no bot.
9) Sustentabilidade e saúde da equipe
Normas de trabalho: noite/fim de semana - suplementos e folgas; máximo noturno (por exemplo, ≤3).
Intervalos: a cada 2-3 horas um intervalo curto; 12h - dois longas obrigatórios.
Fatiguê-watch: limite de horas/n. regra «não mais N P1 por turno por um».
Apoio psicológico, debrife após P1 pesado, tempo integral.
10) Região multi e follow-the-sun
Divida marcas/tenentes por região (EU/LATAM/APAC) com L1 e domínios L2 locais.
O IC regional está escalando para o IC global em incidentes cruzados-regionais.
Hendover cruzado-regional diário (15 min) com transferência de risco e trabalho.
11) Políticas e RACI
Policy "Shift & On-Call': quem, como e quando pisar; substituições; atraso; Reserva.
SoD/acessibilidade: IC/CL/transações financeiras - papéis separados; Promoção JIT só através do bot.
RACI: cada turno tem IC (A), Duty Gerente (A/R), L1/L2 (R), Compliance/Sec (C), manual (I).
12) Ferramentas e dados
Calendário único (com atributos: domínio, região, contato, reserva).
Dashboards de carga de turnos: alert/hora, incidentes/tipo, lançamentos/janelas.
Relatórios de justiça (fair-share) - cobrir noites/dias de folga por pessoas.
Integração com HR/PTO para que a shrinkage seja considerada automaticamente.
13) Métricas de qualidade (KPI/KRI)
Coverage Rate:% horas com composição completa.
MTTA/MTTR por slot: dia/noite/noite.
Handover Defects: os itens da folha de cheques que faltam.
Pager Fatigué: alert/pessoa/ned; chamadas noturnas (objetivo: ↓).
Replacement SLA:% de turnos fechados por substituição ≤ 48 h antes do início.
Training Coverage: proporção de turnos com slot slot para novos operadores.
Fair-Share Index: igualdade de noites/dias de folga por funcionário.
14) Mapa de trânsito de implementação (4-8 semanas)
Ned. 1-2: coletar o histórico de alertas/picos, determinar janelas críticas SLO; selecionar um modelo (8 x 3 ou follow-the-sun), contar FTE e shrinkage.
Ned. 3-4: Publicar o Policy "Shift & On-Call', incluir a folha de cheque hendover, iniciar o calendário geral e comandos de bota '/whoisoncall ', '/handover'.
Ned. 5-6: ajustar escalações e substituições, adicionar relatórios fair-share, sincronizar SAW/lançamentos com turnos, digitar janelas freeze.
Ned. 7-8: retro para queimar e qualidade hendowers, correção de composição noturna, lançamento de programa shadow e certificação IC/CL.
15) Modelos e artefatos
Shift Rota (exemplo para EU, hora de Kiev):Handover Checklist (10 pontos): SLO, incidentes, trabalhos, riscos, lançamentos, provedores, acessíveis, páginas de status, tíquetes abertos, staffing.
Replacement SOP: como fazer substituição, critérios de tolerância, contato de reserva.
Freeze Calendar: eventos/feriados e proibições de RTO/lançamentos.
16) Antipattern
Um on-call para tudo sem divisão de domínio.
Uma noite de 12 horas sem restrições ou interrupções.
Lançamentos em relógios sem IC/CL/CL.
O Hendover está na boca, sem a folha de cheques e gravações.
Ignorar shrinkage → uma falta crônica.
Programa de shadow zero → fragilidade e SPOF sobre as pessoas.
Resultado
O planejamento de turnos é um desafio de engenharia: cálculo de FTE e shrinkage, rotatividade justa e saúde, hendowers rigorosos e integração com alerting/ChatOps/FAB. Este esqueleto fornece uma cobertura SLO 24 x 7 previsível, reações rápidas a incidentes e sustentabilidade empresarial sem queimar equipes.