Optymalizacja kosztów operacyjnych
1) Cele i zasady
Celem jest obniżenie kosztów na jednostkę wartości biznesowej przy zachowaniu SLO i jakości produktu.
Zasady: środek → optymalizacja → automatyzacja; priorytety ROI „SLO-first” (oszczędności nie szkodzą doświadczeniu użytkownika); przejrzystość kosztów (showback/chargeback).
2) Taksonomia wydatków (co dokładnie optymalizujemy)
Infrastruktura: komputer (CPU/GPU), pamięć masowa (SSD/obj), sieć/wyjście, CDN/WAF, kopie zapasowe, rejestrowanie/obserwowalność.
Dane i przesyłanie strumieniowe: Brokers (Kafka), DWH/OLAP (ClickHouse/Query), Caches (Redis/Mem), ETL/Orkiestra.
Łańcuch płatności: przetwarzanie, KYC/AML, punktowanie, zwalczanie oszustw, fundusz obciążeń zwrotnych.
Produkt/marketing: bonusy, darmowe plecy, podmioty stowarzyszone (CPA/RevShare), zakupy w ruchu, imprezy promocyjne.
Operacje/osoby: wsparcie, analiza ryzyka, zgodność, ręczne przepływy pracy.
Licencje/partnerzy: silniki do gier, dostawcy kasyn na żywo, usługi SaaS.
3) Metryka i ekonomia jednostek
Punkt wyjściowy:- $/RPS, $/transaction (deposit/bet/withdrawal), $/active player/month, $/GB-most logs, $/TB-storage/month, $/ML-inference.
- Podsumowanie KPI: Koszt obsługi na segment (geo/urządzenie/kanał).
- $/RPS = (OPEX_infra + OPEX_data + OPEX_3rd + OPEX_ops )/ avg_RPS
- $/transaction = (OPEX_platform + fees_payment + antifraud + support )/ N_tx
- LTV: CAC: CTS - Lifetime Wartość: Koszt nabycia klienta: Koszt obsługi.
4) Obwód FinOps i oszczędności „SLO-aware”
Prysznic/obciążenie zwrotne: podział kosztów przez produkty/zespoły/usługi.
Budżety i wpisy: miesięczne limity i ostrzeżenia o odstępstwach.
SLO-first: wszelkie optymalizacje są testowane: czy SLI jest normalne? p95/p99, wskaźnik błędów, dostępność.
Eksperymenty: oszczędności A/B (w tym kompresja, zmniejszenie zatrzymywania kłód - nie pogorszyło SLI?).
5) Obliczenie: prawy rozmiar i autoskalowanie
Prawy rozmiar: profilowanie CPU/mem, zmniejszanie rozmiarów pod/VM, usuwanie „zagłówka do zagłówka”.
Autoskalowanie: HPA/KEDA według mierników obciążenia/kolejek; recesje nocne/regionalne - agresywna skala.
Modele cen: Zarezerwowane/Plany oszczędności, Miejsce/Preemptible for batch/ETL, regiony hybrydowe.
Aktualizacje runtime: nowoczesne wersje JVM/Go/Node mogą dać -10-30% procesora.
6) Przechowywanie i dane
Klasy przechowywania: hot SSD dla OLTP, zimno/archiwum dla historii i dzienników.
TTL/retencja: zasady dotyczące indeksów/kłód/śladów (na przykład 7-14 dni części p99, kruszywa - dłuższe).
Kompresja i format: Parkiet/ORC dla jeziora, ZSTD dla dzienników, deduplication.
DWH/OLAP: zmaterializowane widoki/agregaty, rozładowywanie „drogich” żądań; ograniczenia ad hoc.
Streaming: kompaktowe tematy, rozmiar partii/akdy są optymalne dla $/msg, kontrola wentylatora.
7) Sieć, wyjście i CDN
Zminimalizuj wyjście: buforowanie krawędzi, ruch szpilkowy w regionie/uczcie.
Ekonomia CDN: wzrost pamięci podręcznej poprzez wersioning, rozsądny TTL, rozmiar obrazu na krawędzi.
Kompresja i protokoły: HTTP/2/3, gzip/br, WebP/AVIF dla mediów.
Rozmowa API: agregacja/masowanie, protokoły gRPC do czatu/strumieniowania.
8) DB i pamięć podręczna: $/request
Profilowanie: top N powolne i częste zapytania; indeksy obejmujące zapytania.
CQRS/Reader Cues: Odładowanie OLTP poprzez odczyt i denormalizację.
Strategie pamięci podręcznej: pamięć podręczna katalogu klucza, sesja/token, listy hot rank; stosunek trafienia i eksmisji.
Limit transakcji: krótkie transakcje, limity paginacji i żądania N + 1.
Architektura: async/kolejki zamiast łańcuchów synchronicznych, idempotencja i retry jitter.
9) Obserwowalność i dzienniki
Ślady próbkowania: dynamiczne, w przypadku incydentów - zwiększenie.
Dzienniki według profilu: ustrukturyzowane, bez nadmiernego poziomu DEBUG w sprzedaży.
Filtrowanie połykania: odcięcie hałasu (brak kontroli sanitarnych), agregacja mierników zamiast surowych kłód.
Deski rozdzielcze SLO: mniej rozproszonych paneli → mniej metryk → mniej połykania.
10) Płatności i zwalczanie nadużyć finansowych (opłaty zewnętrzne)
Mieszanka dostawców: trasa przy najniższej prowizji, z uwzględnieniem konwersji/punktacji ryzyka.
Zmniejszone awarie - Poprawne 3-D Secure/retries → mniej obciążenia pracą i opłat.
Zasady zwalczania nadużyć finansowych: Ukierunkowanie ryzyka, a nie „wszystko”, aby nie przejmować kontroli.
Kontrola obciążenia zwrotnego: wyzwalacze zapobiegawcze dla anomalii w stawkach i wnioskach.
11) Premie, darmowe plecy i wydatki marketingowe
Limity i lejek: personalizacja bonusów za LTV/ocena ryzyka → mniej „nadmiernego karmienia”.
Anty-nadużycie: dedup konta, zasady prędkości, czapki wyjściowe dla promo.
Ruch: SmartLink i filtry po kliknięciu, niska jakość kadłuba źródłowego, przypisanie po wyświetleniu za pomocą okien.
Ekonomika turnieju: pula nagród i oczekiwanej podwyżki ARPPU/zatrzymanie; tor ROI.
12) Operacje i osoby
Automatyzacja rutyny: playbooks, ranbooki, incydenty automatycznego pisania.
Wsparcie: makro, boty pierwszego poziomu, priorytety VIP; samoobsługa na swoim koncie osobistym.
QA i środowiska: efemeryczno-wg PR, dane testowe jako usługa, wyłączanie stoisk stojących.
13) Zarządzanie i procesy
Polityka-as-Code: ograniczenia zasobów, zakaz drogich przypadków bez uzasadnienia.
Zarządzanie zmianą: wydania kanaryjskie - mniej wałków i zmian.
Katalog kosztów: pojedyncze znaczniki/etykiety dla wszystkich zasobów; raport „kto płaci za co”.
Tygodniowe recenzje: Top 10 Budget Eaters, Plan działania i właściciele.
14) Plan działania na rzecz realizacji (12 tygodni)
Tygodnie 1-2: inwentaryzacja kosztów, tagi, deska rozdzielcza podsumowania $/RPS, cele oszczędnościowe.
3-4: prawy rozmiar, HPA/KEDA, czyszczenie dziennika/TTL, pobieranie próbek śladowych.
5-6: DB/cache: indeksy, gorące klucze, denormalizacja, limity paginacji.
7-8: CDN/egress: polityka pamięci podręcznej, kompresja, optymalizacja mediów.
9-10: Płatności/zwalczanie nadużyć finansowych: routing przez dostawców, zmniejszanie niepowodzeń.
11-12: Premie i ruch: personalizacja, przeciwdziałanie nadużyciom, zamykanie kampanii low-ROI.
Po 12 tygodniu - autopilot: showback/chargeback, quarterly target $/unit of value.
15) Deski rozdzielcze
Exec: OPEX według kategorii, $/RPS, $/transakcja, kampanie ROI, oszczędności vs okres bazowy.
Te: recykling CPU/Memory/IO, zdarzenia autoskalujące, cache-hit, p95/p99, połknięcie dziennie/dziennie, egress GB/day.
Dane: koszt zapytań/skanów, zatrzymanie, rozmiar tematów/tabel, koszt na zapytanie.
Płatności: konwersja autoryzacji, średnia prowizja, udział w obciążeniu zwrotnym, czas KYC.
Premie: CPA/RevShare/ARPPU uplift, udział w nadużyciach, wpływ netto na GGR.
16) Wzory artefaktów
Koszt Playbook (na usługę): aktualna wartość, sterowniki, środki (wpływ $/złożoność), właściciel, termin.
Pojemność i koszt arkusz: zagłówek, $/RPS przed i po środkach, wpływ na SLO.
Zasady Katalog-Ważne klasy instancji, limity, wyjątki i proces żądania.
Runbook „Night/Weekend”: agresywne zasady skali/TTL, wstrzymanie pracy bez krytyki.
17) Top 20 szybkich środków („szybkie wygrane”)
1. Włączyć autoskalowanie i zmniejszyć „ponadgabarytowe” dna.
2. Cięcie kłód retencyjnych i śladów do istoty biznesowej.
3. Pobieranie próbek śladowych + agregacje zamiast surowych zdarzeń.
4. Tłumaczenie ciężkich raportów na nocne okna partii/matviews.
5. Zwiększenie pamięci podręcznej CDN ze względu na wersję/TTL.
6. Obrazy WebP/AVIF i leniwe ładowanie.
7. Kompresja wyjść przez region szpilki i kompresji.
8. Indeksy do 10 najlepszych powolnych zapytań, limity paginacji.
9. Cache gorące dane/listy.
10. Wyłączyć nieużywane funkcje/punkty końcowe.
11. Zarezerwowane/Plany oszczędności dla stałego obciążenia.
12. Spot/Preemptible do leczenia ETL/ML.
13. Usuń duplikat połknięcia tego samego typu mierników.
14. Zmniejszyć częstotliwość bezużytecznych koron/ciągnięcia.
15. Płatności na trasie dla dostawców z najlepszą „prowizją × konwersja”.
16. Spersonalizuj bonusy (ograniczenie kosztów na gracza).
17. Zamrożenie kanałów zamówień o niskim natężeniu ruchu.
18. Efemeryczne środowiska testowe na żądanie.
19. Automatyczne zamykanie zasobów bezczynności (VM/stoiska).
20. Politycy za „drogie” instancje i tomy dzienników.
18) Antypattery
Niewidome oszczędności bez metryki i SLO → ukryte straty przychodów.
Masowe odrzucenie kłód/śladów → pogorszenie MTTR i zwiększenie liczby incydentów.
Uniwersalne ustniki bez segmentacji → spadek konwersji płatności/bonusów.
Ignoruj egress/CDN → niewidzialne konta rosną szybciej niż obliczenia.
19) Role i obowiązki (RACI)
Odpowiedzialny: SRE/Platform, Data/FinOps, Billing/Payments, Risk.
Odpowiedzialny: szef działu operacyjnego/CTO.
Konsultacja: Produkt, Marketing, Bezpieczeństwo/Zgodność.
Poinformowany: Wsparcie, Finanse.
20) Kontrola i poprawa
Tygodniowe oszczędności stand-up: progress playbook, blokery, metryki.
Miesięcznie: przegląd $/unit, porównanie z punktem odniesienia, ponowna ocena 10 najlepszych środków.
Kwartał: przegląd umów z dostawcami, migracja klas/instancji składowania.
Razem
Optymalizacja OPEX nie jest jednorazowym „czyszczeniem kont”, ale ciągłym systemem: przejrzystość kosztów → priorytetyzacja środków ROI → optymalizacja techniczna bez szkody dla SLO → automatyzacja i zarządzanie. Dzięki temu podejściu, $/RPS i $/transakcja stale spadają, a jakość usług i szybkość wydań rosną.