Logo GH

Technologia i infrastruktura → AI-Ops i systemy autonomiczne

AI-Ops i systemy autonomiczne

1) Co to jest AI-Ops

AI-Ops to zastosowanie ML/AI do danych operacyjnych (kłody, mierniki, ślady, zdarzenia uwolnienia/incydentu) do:
  • wcześniejsze wykrywanie problemów (przeciwdziałanie incydentom),
  • auto-remediacja
  • optymalizacja kosztów i wydajności (skalowanie predykcyjne, inteligentne trasy),
  • przyspieszenie analizy incydentów (korelacja sygnału, generowanie pośmiertnych).
Autonomiczny system jest w tym kontekście platformą umożliwiającą:

1. czuć (zbierać telemetrię),

2. rozumieć (modele, heurystyka, zasady),

3. działać (dokonać bezpiecznych zmian w produkcie według ranbooków),

4. uczyć się (zamknąć pętlę sprzężenia zwrotnego poprzez analitykę powypadkową).

2) Warstwy architektury AI-Ops

1. Kolekcja telemetryczna (obserwowalność 3-w-1): metryka (Prometheus/OTel), kłody (Loki/ELK), szlaki (OTel/Jaeger).
2. Inżynieria wzbogacania i funkcji: agregacje, okna przesuwne, sezonowość, znaczniki biznesowe ("partner", "game _ id'," region "," VIP "," psp ").

3. Modele i zasady:
  • wykrywanie anomalii (STL, Prorok, Las Izolacji, kodery automatyczne),
  • wykresy przyczynowo-skutkowe (korelacje zależności),
  • klasyfikacja incydentów i ustalanie priorytetów (zasady domeny ML + SRE).
  • 4. Rozwiązania i działania: prowadzenie książek, automatyczne przekładki, przełączanie ruchu, automatyczne skalowanie, zmienianie limitów, śledzenie trasy.
  • 5. Obwód człowiek-maszyna: LLM-copylot dla NOC/SRE, komendy czatu, symulacje „co-jeśli”.
  • 6. Rządy i bezpieczeństwo: zatwierdzenia, zmiany okien, katastroficzne warunki zatrzymania, audyt.

3) Źródła i cechy danych

Infrastruktura: procesor/pamięć/IO/Latency, błędy sieciowe, K8s strąki/węzły, limity/żądania, ciśnienie węzła.
Usługi: RPS/P50/P95/P99, 4xx/5xx, nasycenia, błędy retrasy, zdarzenia wyłącznika.
Sygnały biznesowe: registratsiya → depozit (CR), depozyty GGR/Net, awaria PSP kodem, ruch VIP, turnieje, kampanie promocyjne.
Dodatkowe czynniki: flagi wydań/funkcji, raporty regulacyjne, okna płatności bankowych, mecze/wydarzenia (szczyty zakładów).

Przydatne funkcje: tygodniowa/godzinowa sezonowość, opóźnienia, statystyki toczenia, tempo zmiany, mix błędów według kodów, versiya → versiya deltas, nasycenie-score.

4) Przypadki zastosowania

4. 1 Wczesne wykrywanie incydentów

Nieprawidłowy wzrost awarii 'psp _ decline _ rate' w regionie → automatyczna awaria kopii zapasowej PSP, ograniczona przez segmenty (nie dotykając VIP).
Niestandardowy wzór opóźnień śladowych w łańcuchu 'web → gateway → portfel' → automatyczne szyfrowanie ruchu do zdrowych strąków, ogrzewanie pamięci podręcznej, ponowne uruchomienie poniżających instancji.

4. 2 Zarządzanie przepustowością prognostyczną

Prognoza RPS, biorąc pod uwagę harmonogram meczów i promo → proaktywne skalowanie K8s, ocieplenie połączeń do bazy danych/pamięci podręcznej, kwoty rozliczeniowe w chmurze.
Oszczędności: zmniejszone nadmiar poza szczytem przy zachowaniu SLO.

4. 3 Samouzdrawianie

Zablokowany błąd kolejki wypłat → runbook: pauza konsumencka, deduplikacja, proces DLQ, kontrola idempotencji.
Zdegradowany odłamek DB → ewakuacja odczytów, przełączanie pisarza, ograniczanie pracy w tle.

4. 4 Korelacja i RCA

ML-klastrowanie wpisów (burze alarmowe) + wykresy przyczynowe → jedna „karta incydentu” zamiast dziesiątek wiadomości.
Automatyczna generacja osi czasu incydentów i projekt postmortem.

4. 5 Copilot dla NOC/SRE (LLM)

Polecenie: „pokaż wszystko, co zmieniło się 15 minut przed 5xx spike by/v2/payouts w regionie UE”.
Odpowiedź: diff configs, release notes, metric deltas, affected strąks, hipotezy + przyciski „start ranbook”.

5) Wzory decyzji

Bezpieczna automatyzacja: działanie tylko w „zielonym korytarzu” (gardrail: max% ruchu, maksymalna skala skoku, lista dozwolonych poleceń).
Human-in-the-loop: kroki krytyczne (zmiana głównej bazy danych, masowe ficheflagi) - z potwierdzeniem dyżuru.
Wielowymiarowość: wyzwalacz nie jest jednym wpisem, ale spójność: mierniki + ścieżki + wzór dziennika + znak uwolnienia.
Kanaryjska rekultywacja: najpierw stosować do 1-5% ruchu, a następnie eskalować.
Rollback-by-design: Każda akcja ma wsteczny krok i czas.

6) Książki startowe i książki odtwarzania

Struktura Runbook: stan → weryfikacja → działanie → walidacja → rollback → log.

Przykłady:
  • Zwolnienie PSP> X% w kraju Y: przejdź na trasę B, niższy 'retry _ budget', aktywuj limit cache, otwórz bilet na PSP.
  • Wzrost opóźnień w obsłudze portfela: zwiększenie replik, rozgrzanie limitów kluczy Redis, włączanie trybu „tylko do odczytu” dla ciężkich raportów, ograniczenie agregacji osób trzecich.

7) Modele: Proste do dojrzałych

1. Podstawowe zasady i sezonowość STL: szybki start, niewiele pozytywów ludowych.
2. Nadzorowane modele historii incydentów: klasyfikator krytyki/podsystemu, wskazówka RCA.
3. Unservised/Deep: Autencoder/Las izolacji dla złożonych wzorów.
4. Kształcenie polityczne: szkolenie w zakresie polityki naprawczej (symulacje offline + ograniczone eksperymenty online).

Ważny: modele i magia. Zrób hindsight, drift control, champion-challenger, i zachować funkcje/etykiety.

8) A/B i eksperymenty w operacjach

Eksperymenty na temat rozwiązań operacyjnych: różne strategie retray/timeout, routing PSP, limity połączeń.
Wskaźniki sukcesu: MTTR, spalanie budżetu błędu, cost-per-RPS,% autofiksów ludowych.
Warunki zatrzymania i szybkiego zatrzymania podczas degradacji SLO.

9) Rządzenie, ryzyko i zgodność

Polityka działania: lista dopuszczalnych automatyzacji, obszary ryzyka, zmiany okien, poziomy zatwierdzenia.
Audyt i śledzenie: kto/kiedy/dlaczego uruchomił ranbook; artefakty na postmortem.
PII/PCI: maskowanie w funkcjach/dziennikach, minimalizacja danych, tajne skanowanie.
Rozporządzenie iGaming/fintech: przejrzystość decyzji (możliwość wyjaśnienia), logika przystanków/limitów płatności powinna być powtarzalna i wyjaśnialna.

10) Narzędzia (komin referencyjny)

Obserwowalność: OpenTelemetry, Prometheus, Grafana/Tempo/Jaeger, Loki/ELK.
Katalogi i wiedza: katalog usług, zależność od wykresu, inwentaryzacja konfiguracji/ficheflagów.
ML-pipelines: Funkcja Store, funkcje offline-DWH + online, model-register, modele CI/CD, monitoring dryfu.
Automatyzacja: orkiestra rankingów (Argo/StackStorm/ opisnye), operatorów , GitOps (Argo CD/Flux).
Incydenty: operacje czatu (Slack/Telegram/Teams), boty oglądania, szablony pośmiertne.
Bezpieczeństwo: Skarbiec/KMS, polityka klucza, mTLS, podpis artefakt.

11) Wskaźniki dojrzałości AI-Ops

Wykrywanie: odsetek zdarzeń obserwowanych przed reklamacjami użytkowników; średni ołów detekcji.
Reakcja: MTTA/MTTR,% auto-remediacja bez eskalacji, jakość RCA (precyzja/wycofanie).
Niezawodność: szybkość spalania, przestrzeganie SLO, wpisy na godzinę dyżuru.
Gospodarka: oszczędność $ na obliczeniach (prawowitość), zmniejszenie odchyleń od budżetu, koszt na transakcję.
Kultura: udział incydentów z pośmiertnymi hipotekami, zakres usług z książeczkami startowymi, szybkość wdrażania przepisów.

12) Krok po kroku plan realizacji

1. Słownik telemetrii i ujednoliconego sygnału. Wymagane etykiety: 'service', 'version', 'region', 'partner', 'api _ version'.
2. Anty-hałas i korelacja. Deduplikacja alarmowa, pogrupowana przez incydent.
3. Biblioteka Runbook. Scenariusze dla 10 najlepszych zagrożeń (płatności, portfel, katalogi gier, turnieje, raporty).
4. Podstawowe modele. STL/Prorok + zasady; pilot na 2-3 usługi.
5. Copilot i czat operacje. Naturalne prośby, szybkie działania, szablony pośmiertne.
6. Szyny ogrodnicze i sterowanie. Kanarki, limity działania, ślady audytu.
7. Eksperymenty i szkolenia. Champion-challenger, A/B, retrospektywna ocena korzyści.
8. Skalowanie. Łącząc wszystkie strumienie krytyczne, zespoły szkoleniowe, przegląd SLO.

13) Przykłady polityk i konfiguracji

13. 1 Polityka automatycznego skalowania (pomysł)

Proaktywne skalowanie w prognozie RPS> + X% P95 w zeszłym tygodniu.
Zimny start: ocieplenie połączeń z Redis/PSP, podgrzewanie buforów.
Stan zatrzymania: 5xx błąd rośnie po skale → rollback.

13. 2 książka startowa „degradacja PSP”

1. Sprawdź 'psp _ error _ rate> T' i 'region w {BR, TR}'.
2. Włącz smart-routing na PSP-B tylko dla innych niż VIP; limit 'max _ retries = 2'.
3. Utwórz bilet PSP-A; zebrać 100 żądań/odpowiedzi dla RCA.
4. Monitoruj depozyt i T2W CR (czas do portfela). Rolka przy degradacji> Y%.

13. Szablon 3 postmortem (autogenerowany)

Detektor → Timeline → Hipotezy → Wpływ (Użytkownicy/Przychody) → Działania → Lekcje → Zmiany w książkach startowych/modelach.

14) Anty-wzory

„Czarna skrzynka” bez szyn ogrodniczych: boty rządzą sprzedażą bez ograniczeń i audytu.
Modele bez danych o wydarzeniach biznesowych: patrz procesor, ale nie rozumiesz promo/mecze.
Burze alarmowe: brak korelacji → dyżurna „wizja tunelu”.
Auto-remediacja bez wałka/walidacji wyniku.
„Wieczni piloci”: nie ma wyjścia do prawdziwych działań, tylko deski.
Brak pośmiertnych ofiar śmiertelnych - brak systemu szkoleń.

15) Kontekst iGaming/fintech

Szczyty obciążenia (turnieje, zakłady na żywo, finały): skalowanie predykcyjne, nagrzewanie buforów, przygotowanie limitów PSP.
Odpowiedzialne gry/limity: Modele nie mogą automatycznie podnosić limitów gracza bez dopasowania zasad.
Okna raportowania regulacyjnego: pobierz harmonogramy, pobierz SLA, priorytet kolejki.
Multi-PSP: dynamiczne routing według kraju, pora dnia, kody błędów, koszt transakcji.
Segment VIP: poszczególne szyny ogrodnicze - brak agresywnych działań bez potwierdzenia (człowiek w pętli).

16) Lista kontrolna gotowości

1. Pojedyncza warstwa OTel, jednolite etykiety i utwory przez bramę.
2. Topologia serwisowa.
3. Katalog książek startowych z symulacjami i testami jednostkowymi.
4. Co najmniej jeden model anomalii w raporcie o jakości produktu +.
5. Copilot czatu zdolny do odczytu kłód/mierników i uruchamiania bezpiecznych działań.
6. Szyny ogrodowe, kanarki, kickbacks, zmiany audytów.
7. Regularne pośmiertne i aktualizowanie wiedzy/modeli na podstawie wyników.

Wynik

AI-Ops nie jest „magiczny AI na górze dzienników”, ale dyscyplina: wysokiej jakości telemetria, zrozumiałe ranbooki, ostrożna automatyzacja i kontrolowane modele. Wprowadzając pętlę obserwacji → zrozumienie → działanie → nauka z jasnych szyn ogrodniczych, otrzymujesz samouzdrawiającą platformę, która wcześniej zauważa ryzyko, odzyskuje szybciej i kosztuje biznes mniej.

Contact

Skontaktuj się z nami

Napisz do nas w każdej sprawie — pytania, wsparcie, konsultacje.Zawsze jesteśmy gotowi pomóc!

Telegram
@Gamble_GC
Rozpocznij integrację

Email jest wymagany. Telegram lub WhatsApp są opcjonalne.

Twoje imię opcjonalne
Email opcjonalne
Temat opcjonalne
Wiadomość opcjonalne
Telegram opcjonalne
@
Jeśli podasz Telegram — odpowiemy także tam, oprócz emaila.
WhatsApp opcjonalne
Format: kod kraju i numer (np. +48XXXXXXXXX).

Klikając przycisk, wyrażasz zgodę na przetwarzanie swoich danych.