Schichtplanung
1) Ziele und Rahmenbedingungen
Die Schichtplanung stellt sicher, dass die Plattform kontinuierlich auf Zwischenfälle und Verkehrsspitzen vorbereitet ist, ohne dass Teams ausbrennen. Die Ziele sind:- Gewährleistung der Abdeckung von SLO-kritischen Prozessen (Einlagen, Raten/Settle, Schlussfolgerungen, KYC/AML);
- Reduzierung der MTTA/MTTR zu jeder Tageszeit;
- Einhaltung des Arbeitsrechts und der internen Richtlinien (Wochenenden/Pausen/Nächte).
2) Rollen und Unterstützungsstufen
L1 (NOC/Operations): Primärtriage, Runbook-Start, Eskalationen.
L2 (Domain On-Call): Zahlungen, Spiele/Kern, Daten/Infra - tiefe Diagnose und Fixes.
L3 (SRE/Platform/Dev): Konfigurationsänderungen, Patches, Emergency Releases.
IC/CL (Incident Commander/Comms Lead): Leitet den Vorfall und die Kommunikation.
Duty Manager (im Wechsel): bestätigt Staffing, Risiken, Freeze-Fenster.
3) Schalt- und Rotationsmodelle
3. 1 24 × 7 Abdeckung
8 × 3 (drei acht Stunden): Tag (08: 00-16: 00), Swing (16: 00-00: 00), Nacht (00: 00-08: 00). Einfach zu verwalten, erfordert mehr Mitarbeiter.
12 × 2 (zwei zwölf Stunden): Tag (08: 00-20: 00), Nacht (20: 00-08: 00). Weniger Handler, höhere Ermüdungsgefahr - mit Einschränkungen verwenden.
Follow-the-sun: EU → AMER → APAC, minimale Nacht; erfordert ein verteiltes Team.
3. 2 Rotationsmuster (Beispiel)
Panama/Pitman (2-2, 3-2, 2-3): Wechsel von 12 Stunden mit einem langen Wochenende (erfordert eine strenge Ermüdungskontrolle).
4-on/4-off (12h): 4 Tage à 12h, 4 Wochenenden; geeignet für L1 bei guter Automatisierung.
5 × 8 (klassisch): für L2/L3 + Bereitschaftsdienst in den Nächten/Wochenenden.
3. 3 On-Call-Dienste
Primär/Sekundär: Jede Domain hat einen primären und sekundären On-Call.
Shadow-on-Call: Ausbildung neuer Ingenieure unter den Fittichen von Primary.
4) Berechnung von Zustand und „Schrumpfung“ (shrinkage)
4. 1 Grundformel FTE
Erforderliche FTEs pro Rolle:
FTE = (coverage hours per week/productive FTE hours per week) × (1 + shrinkage)
Wo shrinkage umfasst Urlaub/Krankenhaus/Ausbildung/1: 1/retro/admin-Zeit (in der Regel 20-35%).
Beispiel (L1 24 × 7, 8 Stunden):- 168 Stunden Abdeckung/35 produktive Stunden/Woche ≈ 4. 8
- Bei shrinkage 30% → 4. 8 × 1. 3 ≈ 6. 2 FTE (für Nachhaltigkeit auf 7 runden).
4. 2 Plan für Peaks
Fügen Sie den Peak-Faktor für Veranstaltungen (Top-Matches, Turniere) hinzu: + 10-25% FTE in den Kalenderfenstern. Verwenden Sie historische Alert/Traffic-Charts.
5) SLO-Abdeckung und Risikofenster
Richten Sie eine Matrix kritischer Stunden ein (lokale „Prime Time“ von GEO/Zahlungsmethoden).
Legen Sie eine Mindestbesetzung pro Slot fest (z. B. Night: L1 × 2, L2-Payments × 1 on-call, L2-Games × 1 on-call, IC durch Rotation).
Weisen Sie für Releases/Migrationen einen Release Guard (extra L2/SRE) für einen Zeitraum von + 60 Minuten Post-Monitoring zu.
6) Handover (Schaltgetriebe)
Struktur 10-15 Minuten:1. Status von SLOs/Alerts und offenen Vorfällen.
2. Geplante Arbeiten im Fenster + Risiken.
3. Blocker/Erwartungen (PSP/KYC-Anbieter, Reglement).
4. Vereinbarte Komma-Pläne (Status-Seite, Partner).
5. Überprüfung der Schichtzusammensetzung und der On-Call-Kontakte.
Die Checkliste des Händlers muss im Wiki/Bot sein; Protokoll - in einem Var-Raum oder einem austauschbaren Kanal.
7) Kalender und Ersatz
Planungshorizont: 8-12 Wochen; Ersatz - spätestens 2 Wochen im Voraus (außer bei höherer Gewalt).
Freeze-Perioden: Großveranstaltungen/Feiertage - Urlaubsverbot für Schlüsselrollen (später kompensiert).
Buddy-Regel: Ersatz nur durch einen Ingenieur derselben Domäne/Qualifikation oder mit einem zusätzlichen Schatten.
8) Integration mit der Plattform
Alerting: Routing durch aktive Schicht und Domänen (P1→pager+var-Raum).
Incident-Bot: Befehle '/rota', '/whoisoncall', Auto-Erwähnungen IC/CL.
Freigaben: CAB synchronisiert mit Schichtplan; Freigaben außerhalb der Abdeckung - verboten.
Status-Seite: CL aus aktiver Schicht im Bot bestätigt.
9) Nachhaltigkeit und Teamgesundheit
Arbeitsnormen: Nacht/Wochenende - Zuschläge und Freizeit; maximale Nacht in Folge (z. B. ≤3).
Pausen: alle 2-3 Stunden eine kurze Pause; bei 12h sind zwei lange obligatorisch.
Fatigue-watch: Stunden-/Wochenbegrenzung, Regel „nicht mehr als N P1 pro Schicht für eins“.
Psychologische Unterstützung: Debrief nach schweren P1, Comp-Time.
10) Multi-Region und Follow-the-Sun
Unterteilen Sie die Marken/Tenanten nach Regionen (EU/LATAM/APAC) mit lokalen L1- und L2-Domains.
Regionale ICs eskalieren zu globalen ICs mit überregionalen Vorfällen.
Täglicher überregionaler Handover (15 Min.) mit Risiko- und Arbeitstransfer.
11) Politiker und RACI
Politik „Shift & On-Call“: Wer, wie und wann übernimmt; Ersatz; Verspätung; Reserve.
SoD/Zugänge: IC/CL/Finanztransaktionen - getrennte Rollen; JIT-Erhöhungen nur durch bot.
RACI: Jede Schicht hat IC (A), Duty Manager (A/R), L1/L2 (R), Compliance/Sec (C), Handbuch (I).
12) Tools und Daten
Ein einziger Kalender (mit den Attributen: Domäne, Region, Kontakt, Reserve).
Schaltlast Dashboards: Alerts/Stunde, Incidents/Type, Releases/Windows.
Fairness Reports (Fair-Share): Abdeckung von Nächten/Wochenenden nach Personen.
Integration mit HR/PTO, so dass shrinkage automatisch zählt.
13) Qualitätskennzahlen (KPI/KRI)
Coverage Rate:% Stunden mit voller Besetzung.
MTTA/MTTR durch Slots: Tag/Abend/Nacht.
Handover Defects: Anzahl der fehlenden Checklistenpunkte.
Pager Fatigue: Warnhinweise/Person/Woche; nächtliche Anrufe (Ziel - ↓).
SLA-Ersatz:% geschlossene Schichten durch Ersatz ≤ 48 Stunden vor Beginn.
Training Coverage: Anteil der Schichten mit Shadow Slot für neue Betreiber.
Fair-Share Index: Einheitlichkeit der Nächte/Wochenenden nach Mitarbeitern.
14) Umsetzungsfahrplan (4-8 Wochen)
Ned. 1-2: Allert-/Peak-Historie sammeln, SLO-kritische Fenster definieren; Wählen Sie ein Modell (8 × 3 oder follow-the-sun), zählen Sie FTE und shrinkage.
Ned. 3-4: Veröffentlichen Sie die Richtlinie „Shift & On-Call“, aktivieren Sie die Handover-Checkliste, führen Sie den allgemeinen Kalender und die Bot-Befehle „/whoisoncall “, „/handover“ aus.
Ned. 5-6: Eskalationen und Substitutionen debuggen, Fair-Share-Berichte hinzufügen, CAV/Releases mit Schichten synchronisieren, Freeze-Fenster eingeben.
Ned. 7-8: Retro durch Burnout und Qualität der Handler, Korrektur der Nachtzusammensetzung, Start des Schattenprogramms und IC/CL-Zertifizierung.
15) Muster und Artefakte
Shift Rota (Beispiel für EU, Kiew Zeit):Handover Checklist (10 Punkte): SLOs, Vorfälle, Jobs, Risiken, Freigaben, Anbieter, Zugriffe, Statusseiten, offene Tickets, Staffing.
Ersatz SOP: So ordnen Sie Ersatz, Aufnahmekriterien, Reservekontakt an.
Freeze Calendar: Veranstaltungen/Feiertage und Verbote für RTOs/Releases.
16) Antipatterns
Ein On-Call für alles ohne Domain-Trennung.
12-stündige Nächte in Folge ohne Einschränkungen und Unterbrechungen.
Freigaben in Stunden ohne IC/CL/CL-Verfügbarkeit.
Hendover „auf das gesprochene Wort“, ohne Checkliste und Eintragungen.
Ignoriere shrinkage → einen chronischen Unterkomplex.
Das Zero-Shadow-Programm → Fragilität und SPOF beim Menschen.
Summe
Schichtplanung ist eine technische Herausforderung: FTE und Shrinkage-Berechnung, ehrliche Rotation und Gesundheitsschutz, rigorose Handovers und Integration mit Alerting/ChatOps/CAB. Ein solcher Rahmen bietet eine vorhersehbare 24 × 7-SLO-Abdeckung, schnelle Reaktionen auf Vorfälle und geschäftliche Nachhaltigkeit, ohne dass Teams ausgebrannt sind.