Interakcje zespołów w operacjach
1) Dlaczego
Platforma iGaming to dziesiątki domen (Płatności, Gry/Rdzeń, Ryzyko/KYC, Dane, Infra/SRE, Wsparcie, Zgodność). Bez sformalizowanej interoperacyjności zwiększa się MTTR, CFR i ryzyko operacyjne. Celem jest przekształcenie rozbieżnych funkcji w jeden system operacyjny: przewidywalne kontakty, przezroczyste kolejki, wspólne sygnały i spójny priorytet.
2) Zasady
1. SLO-first: wspólne rozwiązania są powiązane z budżetami SLO/błędów.
2. Jedno źródło prawdy: wspólne deski rozdzielcze, jednolite statusy i artefakty.
3. Wyczyść granice i interfejsy: każda para poleceń ma opisaną umowę (OLA/Runbook/API).
4. Małe partie i odwracalność: zmiany poprzez phicheflags/canary, szybki zwrot.
5. Brak winy - tak dane: odparcie faktów, ulepszenia - obowiązkowa część cyklu.
6. Minimalne wymagane uprawnienia i SoD: oddzielenie ról dla operacji wrażliwych.
7. Zautomatyzuj rutynę, ustandaryzuj resztę.
3) Role i RACI (end-to-end)
Szef Ops/SRE Lead jest właścicielem ram operacyjnych, KPI/KRI. A
Właściciele usług (Płatności/Gry/KYC/Dane) - cele domeny, zmiany, ryzyko. A/R
Platforma/Infra - dostępność, wydajność, wydania/kanarki. R
Ryzyko/zgodność/bezpieczeństwo - SoD, RG/KYC/PII, audyty. C/A
Wsparcie/CRM - przedmiot skarg, komunikacja z graczami. R/C
Dyżurny IC/CL - zarządzanie incydentami i aktualizacje zewnętrzne. R
Release Manager - kalendarz, CAB, status zmian. R
Data/Analytics - metryka produktowa i operacyjna, wsparcie RCA. R/C
4) Umowy o interakcję (OLA/SLx)
OLA (umowa o poziomie operacyjnym) - umowy wewnętrzne między zespołami (nie zewnętrzne SLA). Zalicz:- Obszary odpowiedzialności: których obszar (na przykład routing PSP - płatności; pamięci podręcznej/DB - Infra).
- Cele/wskaźniki progowe: incydent MTTA, czas reakcji na eskalację, okno po monitorowaniu.
- Kolejki i priorytety: P1-P4, krytyka biznesowa, zamrażanie okien.
- Interfejsy: kanały, polecenia bot, API/Runbook, katalogi właściciela.
- Artefakty: jakie dokumenty/dzienniki/deski rozdzielcze są wymagane, aby towarzyszyć wydarzeniu.
5) Kanały i protokoły komunikacyjne
Czat operacyjny (shift): codzienne aktualizacje, mini-rytuały, przekazanie.
Var pokoje dla incydentów: stworzone przez bot; Role IC/CL są przypisywane przez polecenie.
Kanał CAB/Change: omówienie zmian, ryzyka, kalendarz zwolnień.
Tylko do odczytu SLO/Incydent/Planowane podsumowania działań
Eskalacja: szablony poleceń '/page ', '/escalate', raportowanie SLA.
Ujednolicony protokół wiadomości: „fakt → impact → ETA/ETR → następne okno aktualizacji → właściciel”.
6) Poręcze między zmianami a regionami
Szablon 10-15 minut:1. SLO/SLI: gdzie jest ryzyko wypalenia budżetu.
2. Otwarte incydenty/eskalacje i ich ETA.
3. Planowane prace/wydania w ciągu najbliższych 24-48 godzin.
4. Dostawcy (PSP/KYC/studios): aktywne bilety, oczekiwania.
5. Skład dyżurów i kontakty (IC/CL/domeny).
6. „Lista obserwacyjna” - obszary zwiększonej uwagi (kolejki/replikacja/pamięć podręczna).
Przekazanie jest rejestrowane w dzienniku zmiany, linki - do pokoi i desek rozdzielczych.
7) Współpraca w zakresie incydentów
Start: alert → bot tworzy kartę '# inc-RRRY-MM-DD-XXX', przypisuje IC/CL i prowadzenie domeny.
Zasada jednego głosowania: IC jest ostateczną decyzją; CL - komunikacja.
Fakty i hipotezy: rozdzielamy; „czerwone” sygnały - priorytet.
Poręcze: phicheflags/PSP routing zmienia się tylko przez runbook z SoD/dual-control.
Komunikaty: projekty publicznych aktualizacji za pośrednictwem CL, partnerzy - ukierunkowane.
Zamknięcie: po monitorowaniu, poubojowym wytwarzaniu i doskonaleniu zadań z właścicielami/terminami.
8) Współpraca w zakresie zmian
Kalendarz wydania: publiczny, z okresami zamrożenia i dyżurów.
Bramy jakości: jednostka/kontrakt/e2e, zabezpieczenie, ustawienie bram SLO.
Walcowanie kanaryjskie: krok po kroku 5% → 25% → 100% dla GEO/najemców/banków.
Auto-rollback: polityka przez key SLI/KRI, magazyn WORM.
Pakiety comm: projekty aktualizacji uzgodnione z wyprzedzeniem z CL/Legal.
Zmiany RACI: RM (A/R), SO (A/R), SRE (R), Sec/Compliance (C/A), CAB (A), IC/CL (R/C).
9) Jednolita telemetria i artefakty
Wspólny katalog mierników: SLI/SLO, metryki biznesowe, KRI (kolejki, PSP, replikacja).
Deska rozdzielcza „Mapa operacji”: podsumowanie według domen, regionów, stanu zdarzeń/prac.
Linie czasowe: jednolity format (czas, autor, akcja, wynik, linki).
pośmiertne: wzór bez opłat, środki zapobiegawcze, data zmiany.
Zakładki/Listy kontrolne: wersjonowane; link z wpisów i kart incydentów.
10) Ustalanie priorytetów i planowanie
Cotygodniowy plan operacyjny (30-45 min): koordynacja największych zagrożeń, uwolnień, limitów, ulepszeń po śmierci.
Kanban operacji: kolumny 'Backlog → Ready → W toku → Validate → Done', limity WIP.
Kryteria priorytetowe: wpływ na SLO/dochody/zgodność, wielkość/odwracalność, zależność od dostawców.
11) Matryca eskalacji (ściskanie)
12) Polityka i SODS
SoD/4-eyes: wnioski/premie/routing PSP/eksport PII - tylko za podwójną zgodą.
Prawa JIT: tymczasowa eskalacja przywilejów dla działań w ramach książki startowej.
Polityka danych: zakaz PII w otwartych kanałach/deskach rozdzielczych; granice geograficzne.
Audyt - niezmienne dzienniki aktywności (WORM), zmiany polityki.
13) Narzędzia interakcji
bot incydent: '/incydent new ', role, timers update, comm drafts, '/runbook', '/flag ', '/config'.
Metryki API: wspólny widok SLO i KRI, przykłady (trace_id) dla RCA.
Uwolnienie-portal: manifesty, bramy, status rolling/rollback.
Katalog właścicieli/CMDB: domeny, kontakty, kanały kopii zapasowych.
14) Wskaźniki współpracy (KPI/KRI)
MTTA/MTTR według domeny i czasu na start lub lądowanie (dzień/noc), odsetek incydentów złapanych przed reklamacjami.
Przekazywanie jakości: usterki transmisji (pozycje listy kontrolnej nie zamknięte na czas).
Zmiana współpracy:% wydań z gotowymi pakietami komunikacyjnymi i brak zwrotów.
Dyscyplina Guardrail: częstotliwość naruszeń SoD/polityki (cel 0).
Comms Cadence: przestrzeganie publicznych zaktualizowanych odstępów czasu po P1/P2.
Pośmiertne SLA: odsetek poubojów ≤ D + 5, zakończenie działań.
Fair-share Load: Dystrybucja nocy/szczytów przez ludzi/zespoły.
Ołów sygnału klienta: Opóźnienie między obiektywną degradacją a pierwszymi skargami.
15) Plan realizacji (6-10 tygodni)
Ned. 1-2: inwentaryzacja domeny/właściciela; szablony OLA; uruchomienie kanału zastępczego i przekazanie listy kontrolnej; macierz eskalacji podstawy.
Ned. 3-4: incydent-bot (MVP), wspólny kanał statusu, pojedyncza karta SLO/SLI/KRI; katalog książek startowych.
Ned. 5-6: kalendarz CAB/release, pakiety komunikacyjne i okna zamrażania; SoD/4-eyes dla wrażliwych operacji.
Ned. 7-8: standardowo walcowanie kanarkowe i automatyczne wałkowanie; szablon pośmiertny, współpraca Exec/Ops-dashboards.
Ned. 9-10: ćwiczenia P1, przekrojowe ręce, audyty WORM, raporty KPI/KRI, korekty OLA.
16) Szablony (fragmenty)
16. 1 OLA (Płatność w Infra/SRE)
yaml ola:
scope: "Payments-Auth & Routing"
contacts:
payments_so: "@pay-so"
infra_oncall: "@sre-oncall"
objectives:
mtta_p1: "≤5m"
rollback_ttr: "≤10m canary"
interfaces:
runbooks: ["psp-failover", "reroute", "auth-throttle"]
dashboards: ["auth_success", "psp_latency", "queue_lag"]
escalation:
p1: ["IC","Payments Lead","SRE L2"]
p2: ["Payments OnCall","SRE OnCall"]
artifacts:
status_templates: ["public","partners"]
postmortem_due: "D+5"
16. 2 Lista kontrolna (10 pozycji)
1. Statusy domeny SLO
2. Incydenty otwarte (ETA/właściciele)
3. Planowane działania/wydania + okna obserwacyjne
4. Dostawcy (PSP/KYC/Studios) - Ryzyko/Oczekiwania
5. Kolejki/replikacja/pamięć podręczna - lag/anomalie
6. Zmiany limitu/Phicheflag
7. Reklamacje/bilety i progi obciążenia
8. Plany przecinka i projekty statusu
9. Skład dyżurów i rezerwa
10. „Lista obserwacyjna” na szczelinę
17) Antypattery
„Czy ktoś się dogada?” bez RACI i właściciela.
Incydenty bez IC/CL i aktualizacji timerów.
Ukryte zmiany (kliknięcia ręczne), brak Git/Audyt.
Telemetria niejednolite: różne liczby w różnych zespołach.
Uwolnienia bez pakietów komunikacyjnych i kanarków.
Naruszenie SoD „dla dobra szybkości”.
Ręczniki doustnie, bez zapisów i list kontrolnych.
zwłoki bez działań i terminów.
Razem
Interakcja zespołów w operacjach to współpraca umowna: OLA/SLx, jasne kanały i role, dyscyplina przekazania, ogólna telemetria, skoordynowane wydania i procesy incydentów. Takie ramy ograniczają MTTR i CFR, dostosowują priorytety, chronią SLO, dochody i zgodność oraz sprawiają, że codzienne działania są przewidywalne i zrównoważone.