Planification des quarts de travail
1) Objectifs et cadres
La planification des quarts assure la disponibilité continue de la plate-forme en cas d'incidents et de pics de trafic sans épuiser les équipes. Objectifs :- garantir la couverture des processus critiques de SLO (dépôts, taux/settle, conclusions, KYC/AML) ;
- réduire MTTA/MTR à tout moment de la journée ;
- se conformer à la législation du travail et aux politiques internes (week-end/pause/nuit).
2) Rôles et niveaux de soutien
L1 (NOC/Opérations) : triage primaire, lancement du runbook, escalade.
L2 (Domain On-Call) : Payments, Games/Core, Data/Infra - diagnostics profonds et fictions.
L3 (SRE/Platform/Dev) : modifications de configuration, correctifs, versions d'urgence.
IC/CL (commandant d'incident/chef de comité) : dirige les incidents et les communications.
Duty Manager (par changement) : confirme staffing, risques, fenêtres freeze.
3) Modèles de quarts et rotations
3. 1 24 × 7 couverture
8 × 3 (trois huit heures) : Day (08 : 00-16 : 00), Swing (16 : 00-00 : 00), Night (00 : 00-08 : 00). Facile à gérer, nécessite plus d'employés.
12 × 2 (deux douze heures) : Jour (08 : 00-20 : 00), nuit (20 : 00-08 : 00). Moins de hendovers, plus de risque de fatigue - à utiliser avec des restrictions.
Follow-the-sun : EU → AMER → APAC, minimum nocturne ; nécessite une équipe distribuée.
3. 2 Modèles de rotation (exemple)
Panama/Pitman (2-2, 3-2, 2-3) : alternance de 12 heures avec un long week-end (nécessite un contrôle strict de la fatigue).
4-on/4-off (12h) : 4 jours de 12 h, 4 week-ends ; convient à la L1 avec une bonne automatisation.
5 × 8 (classique) : pour les L2/L3 + service nuit/week-end.
3. 3 Service sur appel
Primaire/Secondaire : chaque domaine a un primaire et secondaire sur-appel.
Shadow-on-call : formation de nouveaux ingénieurs sous l'aile Primary.
4) Calcul de l'état et du « retrait » (shrinkage)
4. 1 Formule de base ETP
ETP requis pour le rôle :
FTE = (coverage hours per week/productive FTE hours per week) × (1 + shrinkage)
Où shrinkage comprend vacances/hôpital/formation/1 : 1/rétro/admin-temps (habituellement 20-35 %).
Exemple (L1 24 × 7, 8 heures) :- 168 heures de couverture/35 heures de production/salaire ≈ 4. 8
- Avec un shrinkage de 30 % → 4. 8 × 1. 3 ≈ 6. 2 ETP (arrondir à 7 pour la durabilité).
4. 2 Plan de pics
Ajoutez un facteur de pic pour les événements (top matchs, tournois) : + 10-25 % ETP aux fenêtres du calendrier. Utilisez les graphiques historiques alertes/trafic.
5) Couverture SLO et fenêtres à risque
Composez une matrice d'heures critiques (« prime time » local GEO/méthodes de paiement).
Réglez la composition minimale sur la fente (par exemple, Night : L1 × 2, L2-Payments × 1 on-call, L2-Games × 1 on-call, IC par rotation).
Pour les releases/migrations, assignez la release guard (dop. L2/SRE) pour la période et + 60 min de post-monitoring.
6) Hendovers (transfert de poste)
Structure 10-15 minutes :1. Statut SLO/alertes et incidents ouverts.
2. Travaux planifiés dans la fenêtre + risques.
3. Bloqueurs/attentes (fournisseurs PSP/KYC, règlement).
4. Plans d'action convenus (page de statut, partenaires).
5. Vérification de la composition du poste et des contacts sur appel.
La chèque hendover doit être en wiki/bot ; protocole - dans une salle de var ou un canal de remplacement.
7) Calendrier et remplacements
Horizon de planification : 8-12 semaines ; remplacements - au plus tard 2 semaines à l'avance (sauf cas de force majeure).
Périodes freeze : grands événements/fêtes - interdiction des congés pour les rôles clés (compensé plus tard).
Buddy-rule : remplacement uniquement par un ingénieur du même domaine/qualification ou avec dop. shadow.
8) Intégrations avec la plate-forme
Alerting : routage par changement actif et domaines (P1→pager+var -rum).
Incident-bot : commandes '/rota ', '/whoisoncall', auto-mention IC/CL.
Communiqués : L'ACR est synchronisé avec la programmation des quarts ; les rejets hors couverture sont interdits.
Page d'état : CL du poste actif confirmé dans le bot.
9) Durabilité et santé de l'équipe
Normes de travail : nuit/week-end - suppléments et congés ; maximum de nuit consécutive (par exemple, ≤3).
Pauses : toutes les 2 à 3 heures, une courte pause ; à 12h, deux longs sont obligatoires.
Fatigue-watch : limite d'heures/ned, règle « pas plus de N P1 par changement de poste ».
Soutien psychologique : débrief après des P1 sévères, temps compact.
10) Multi-région et follow-the-sun
Divisez les marques/tenants par région (UE/LATAM/APAC) avec L1 locale et L2 de domaine.
Les IC régionales progressent vers les IC mondiales en cas d'incidents intersectoriels.
Hendover cross-régional quotidien (15 min) avec transfert des risques et travaux.
11) Politiques et RACI
Politique "Shift & On-Call' : qui, comment et quand intercède ; remplacements ; les retards ; réserve.
SoD/accès : IC/CL/opérations financières - rôles séparés ; Promotion JIT uniquement par le bot.
RACI : chaque poste est IC (A), Duty Manager (A/R), L1/L2 (R), Compliance/Sec (C), manuel (I).
12) Outils et données
Calendrier unique (avec attributs : domaine, région, contact, réserve).
Dashboards de charge de travail : alertes/heure, incidents/type, sorties/fenêtres.
Rapports d'équité (fair-share) : couverture nuit/week-end par personne.
Intégration avec HR/PTO pour que shrinkage soit automatiquement considéré.
13) Métriques de qualité (KPI/KRI)
Taux de couverture :% des heures avec la composition complète.
MTTA/MTR par slot : jour/soir/nuit.
Handover Defects : kol-in les points manquants de la liste de contrôle.
Pager Fatigue : Alert/personne/ned. ; appels de nuit (objectif - ↓).
Replacement SLA : du % des remplacements fermés par le remplacement ≤ 48 ч jusqu'au début.
Coverage de formation : proportion de postes avec slot shadow pour les nouveaux opérateurs.
Indice Fair-Share : uniformité des nuits/week-ends par employé.
14) Feuille de route pour la mise en œuvre (4-8 semaines)
Ned. 1-2 : recueillir l'histoire des alertes/pics, déterminer les fenêtres critiques de SLO ; choisissez un modèle (8 × 3 ou follow-the-sun), comptez FTE et shrinkage.
Ned. 3-4 : publier la politique "Shift & On-Call', inclure la liste de contrôle hendover, lancer le calendrier général et les commandes du bot '/whoisoncall ', '/handover'.
Ned. 5-6 : déboguer les escalades et les remplacements, ajouter des rapports fair-share, synchroniser les SAV/versions avec les changements, entrer les fenêtres freeze.
Ned. 7-8 : rétro sur le burn-out et la qualité des hendovers, correction de la composition des nocturnes, lancement du programme shadow et certification IC/CL.
15) Modèles et artefacts
Shift Rota (exemple pour l'UE, heure de Kiev) :Handover Checklist (10 points) : SLO, incidents, travaux, risques, sorties, fournisseurs, accès, pages de statut, tickets ouverts, staffing.
Replacement SOP : comment faire un remplacement, critères d'admission, contact de réserve.
Calendrier Freeze : événements/fêtes et interdictions de RTO/sorties.
16) Anti-modèles
Un on-call sur tout sans séparation de domaine.
Les nuits de 12 heures consécutives sans restrictions ni pauses.
Sorties en heures sans accès IC/CL/CL.
Hendover « à l'oral », sans chèque ni enregistrement.
L'ignorance du shrinkage → un sous-ensemble chronique.
Programme shadow zéro → fragilité et SPOF par personne.
Résultat
La planification des quarts de travail est une tâche d'ingénierie : calcul des ETP et shrinkage, rotation équitable et protection de la santé, handovers rigoureux et intégration avec alerting/ChatOps/BOU. Un tel cadre offre une couverture de SLO prévisible 24 × 7, des réponses rapides aux incidents et la résilience de l'entreprise sans épuisement des équipes.