Pianificazione dei turni
1) Obiettivi e cornici
La pianificazione dei turni garantisce la disponibilità continua della piattaforma agli incidenti e ai picchi di traffico senza bruciare i comandi. Obiettivi:- garantire la copertura dei processi SLO-critici (depositi, tassi/settl, conclusioni, KYC/AML);
- Ridurre MTTA/MTTR a qualsiasi ora del giorno;
- rispettare le leggi sul lavoro e le politiche interne (fine settimana/pausa/notturna).
2) Ruoli e livelli di supporto
L1 (NOC/Operations) - Triaggio primario, avvio runbook, escalation.
L2 (Domain On-Call): Payments, Games/Core, Data/Infra - diagnostica e fissaggio approfonditi.
L3 (SRE/Platform/Dave) - Modifiche alle configurazioni, patch, rilasci di emergenza.
IC/CL - Gestisce l'incidente e le comunicazioni.
Duty Manager - Conferma lo staffing, i rischi, le finestre freeze.
3) Modelli di turni e turni
3. 1 24 x 7 copertura
8 x 3 (tre ore e otto): Day (08: 00-16: 00), Swing (16: 00-00: 00), Night (00: 00-08: 00). Facile da gestire, richiede più personale.
12 x 2 (2 ore): Day (08: 00-20: 00), Night (20: 00-08: 00). Meno hendover, più rischio di stanchezza.
Follow-the-sun: EU-AMER-APAC, minime notturne; richiede un comando distribuito.
3. 2 Modelli di rotazione (esempio)
Panama/Pitman (2-2, 3-2, 2-3): alternanza di 12 ore con fine settimana prolungato (richiede un rigoroso controllo della fatica).
4-on/4-off (12h): 4 giorni da 12 ore, 4 weekend; adatto per L1 con una buona automazione.
5 x 8 (classico): per L2/L3 + servizio on-call notti/weekend.
3. 3 Turni on-call
Primary/Secondary - Ogni dominio ha un primario e secondario on-call.
Shadow-on-call - Formazione di nuovi ingegneri sotto l'ala Primary.
4) Calcolo stato e «ritiro» (shrinkage)
4. 1 Formula base FTE
FTE richiesto per il ruolo:
FTE = (coverage hours per week/productive FTE hours per week) × (1 + shrinkage)
Dove shrinkage include ferie/ospedale/formazione/1: 1/retro/admin-time (generalmente 20-35%).
Esempio (L1 24 x 7, 8 ore):- 168 ore di copertura/35 ore produttive/ ≈ 4. 8
- Con shrinkage 30% → 4. 8 × 1. 3 ≈ 6. 2 FTE (arrotondare a 7 per la sostenibilità).
4. 2 Piano per picchi
Aggiungi il fattore di picco per gli eventi (top match, tornei): + 10-25% FTE nelle finestre di calendario. Utilizzare i grafici storici degli alert/traffico.
5) Rivestimento SLO e finestre a rischio
Estrarre la matrice dell'orologio critico (GEO locale/metodi di pagamento).
Impostare la composizione minima sullo slot (ad esempio Night: L1 x 2, L2-Payments x 1 on-call, L2-Games x 1 on-call, IC di rotazione).
Per i rilasci/migrazioni, assegnare un rilease guard (supplemento L2/SRE) per il periodo e + 60 min post-monitoraggio.
6) Hendover (cambio di turno)
Struttura 10-15 minuti:1. Stato SLO/alert e incidenti aperti.
2. Operazioni pianificate nella finestra + rischi.
3. Blocker/attesa (PSP/KYC provider, regolamento).
4. Piani comm coerenti (stato pagina, partner).
5. Controlla la composizione dei cambi e i contatti on-call.
Lo scontrino hendover deve essere in wiki/bot; protocollo - in una sala di controllo o in un canale di cambio.
7) Calendario e sostituzioni
Orizzonte di pianificazione: 8-12 settimane; sostituzioni - entro 2 settimane (tranne forza maggiore).
Periodi freeze: eventi/festività di grandi dimensioni - Divieto di ferie per ruoli chiave (compensato successivamente).
Buddy-rule - Sostituisci solo con un ingegnere dello stesso dominio/qualifica o con uno shadow.
8) Integrazione con la piattaforma
Alerting: instradamento di turno attivo e domini (P1→pager+var rum).
Incidente-bot: comandi «/rota », «/whoisoncall», riferimento automatico IC/CL.
Release: Il CAB è sincronizzato con la pianificazione dei turni; I comunicati fuori copertura sono vietati.
Stato pagina: CL dal cambio attivo confermato nel bot.
9) Sostenibilità e salute del team
Norme sul lavoro: notturni/weekend - supplementi e giorni di ferie; massimo notturno (ad esempio, ≤3).
Pause: ogni 2-3 ore breve pausa; 12h - Due lunghi obbligatori.
Fatige-watch - Limite ore/n. Regola «non più di N P1 per turno a testa».
Supporto psicologico: debrief dopo P1 pesante, PC-time.
10) Multi-regione e follow-the-sun
Separare i marchi/tenenti per regione (EU/LATAM/APAC) con L1 e L2 locali.
Gli IC regionali stanno scalando verso un IC globale in caso di incidenti a livello regionale.
Hendover crociato-regionale giornaliero (15 min) con trasferimento di rischi e lavori.
11) Regole e RACI
Policy «Shift & On-Call»: chi, come e quando accetta; Sostituzioni; in ritardo; riserva.
SoD/disponibilità: IC/CL/transazioni finanziarie - ruoli separati; Aumento JIT solo tramite bot.
RACI: ogni turno ha IC (A), Duty Manager (A/R), L1/L2 (R), Compliance/Sec (C), manuale (I).
12) Strumenti e dati
Un unico calendario (con attributi: dominio, regione, contatto, riserva).
Dashboard carichi turni: alert/ora, incidenti/tipo, comunicati/finestre.
Rapporti di equità (fair-share) - Coprire notti/weekend per persona.
Integrazione con HR/PTO in modo che shrinkage sia considerato automaticamente.
13) Metriche di qualità (KPI/KRI)
Coverage Rate:% ore complete.
MTTA/MTTR slot: giorno/sera/notte.
Handover Defects: le voci mancanti del foglio di assegno.
Pager Fatige: alert/persona/ned; chiamate notturne (obiettivo ↓).
Replacement SLA:% turni chiusi sostituendo 48 ore prima dell'inizio.
Training Coverage: parte dei turni con slot shadow per i nuovi operatori.
Fair-Share Index: uniformità notturna/fine settimana dei dipendenti.
14) Road map di implementazione (4-8 settimane)
Ned. 1-2 - Raccogliere la storia degli alert/picchi, identificare le finestre critiche SLO; Selezionare un modello (8 x 3 o follow-the-sun), contare FTE e shrinkage.
Ned. 3-4 - Pubblica Policy «Shift & On-Call», abilita un assegno hendover, avvia il calendario generale e i comandi «/whoisoncall », «/handover».
Ned. 5-6 - Correggere l'ingrandimento e la sostituzione, aggiungere report fair-share, sincronizzare CAV/release con i cambi, immettere le finestre freeze.
Ned. 7-8: retro per bruciatura e qualità degli hendover, correzione della composizione delle notturne, avvio del programma shadow e certificazione IC/CL.
15) Modelli e manufatti
Shift Rota (esempio per EU, tempo di Kiev):Handover Checklist (10 punti): SLO, incidenti, lavori, rischi, rilasci, provider, accessibili, pagine di stato, tessuti aperti, staffing.
Replication SOP - Come formalizzare la sostituzione, i criteri di tolleranza, il contatto di riserva.
Freeze Calendar: eventi/festività e divieti RTO/release.
16) Antipattern
Una on-call per tutto senza separazione di dominio.
Dodici notti consecutive senza limiti o interruzioni.
Rilasci in orologi senza disponibilità IC/CL/CL.
Hendover è sulla parola orale, senza un assegno o un record.
Ignorare shrinkage è un problema cronico.
Il programma shadow zero → la fragilità e lo SPOF sulle persone.
Totale
Pianificare i turni è una sfida ingegneristica: calcolo FTE e shrinkage, corretta rotazione e salute, hendover rigorosi e integrazione con alerting/ChatOps/CAV. Questa struttura offre una copertura SLO 24 x 7 prevedibile, reazioni rapide agli incidenti e resilienza aziendale senza bruciare i comandi.