技術和基礎設施→ AI-Ops和獨立系統
AI-Ops和獨立系統
1)什麼是AI-Ops
AI-Ops是ML/AI在操作數據(徽標,度量,預告片,發布/事件事件)中的應用,以便:- 更早地發現問題(事件防護),
- 自動修復故障(自動修復),
- 優化成本和性能(謂詞滑行,智能漫遊),
- 加快事件分析(信號相關性、驗屍生成)。
1.感覺(收集遙測),
2.理解(模型、啟發式、規則),
3.采取行動(對銷售進行安全更改),
4.學習(通過事後分析結束反饋回路)。
2) AI-Ops-structure層
1.遙測收集(Observability 3-in-1):度量(Prometheus/OTel),logi(Loki/ELK),traces(OTel/Jaeger)。
2.豐富與微調工程:聚合,滑動窗口,季節性,業務標簽(「合作夥伴」,「game_id」,「區域」,「VIP」,「psp」)。
- 異常檢測(STL,Prophet,Isolation Forest,自動編碼器),
- 因果圖(相關性),
- 事件分類和優先級(ML+SRE域規則)。
- 4.解決方案和行動:ranbook,自動回程,交通切換,自動滑行,更改限制,追隨者路由。
- 5.人機輪廓:NOC/SRE的LLM副本,聊天命令,「如果」模擬。
- 6.州長與安全:批準,變更窗口,災難性的停車條件,審計。
3)數據源和fichi
基礎架構:CPU/Memory/IO/Latency,網絡錯誤,Pod/Node K8s,限制/請求,註釋壓力。
服務:RPS/P50/P95/P99, 4xx/5xx, saturations, retrais錯誤,電路斷路器事件。
業務信號:registratsiya→depozit (CR)、GGR/Net Deposits、PSP代碼故障、VIP流量、錦標賽、促銷活動。
額外因素:發布/ficheflagi,監管報告,銀行支付窗口,比賽/活動(利率高峰)。
有用的fici:每周/每小時的季節性,瀉湖,滾動狀態,變化率,代碼錯誤混合,三角洲versiya→versiya,衛星得分。
4)應用案例
4.1及早發現事件
該地區「psp_decline_rate」故障的異常增長→每個冗余PSP的自動收發器,該收發器僅限於片段(不接觸VIP)。
「Web gateway → wallet」鏈中的非標準跟蹤延遲模式→將自動加密的流量→到健康的poda,加熱緩存,重新啟動降級實例。
4.2謂詞capasity管理
RPS預測包括比賽時間表和促銷→主動滑行K8s,加熱DB/緩存連接,雲計費配額。
節省:在保持SLO的同時,減少了峰值外的過載。
4.3自動還原(自我治療)
「stuck payouts queue」錯誤→ ranbook:用戶暫停、重復數據消除、DLQ復制過程、等效性控制。
降級的DB硬件→讀取疏散,作者切換,背景喬布斯的旋轉。
4.4相關性與RCA
ML聚類Alert(警報風暴)+因果圖→一個「事件卡」而不是數十條消息。
事件的時間線自動生成和驗屍草稿。
4.5 NOC/SRE(LLM)的副產品)
團隊: 「展示歐盟地區5xx/v2/payouts激增前15分鐘發生的一切變化。」
答:diff configs,發行說明,delta度量,受影響的子圖,假設+「啟動運行手冊」按鈕。
5)決策模式
安全自動化:僅在「綠色走廊」中操作(gardrail: max%的流量,max-step scale,允許的命令列表)。
人體循環:關鍵步驟(DB大師切換,質量鎖定)-通過呼叫確認。
多重性:觸發器不是單一的警報,而是一致性:度量+tresa+log模式+發布特征。
金絲雀還原:首先應用1-5%的流量,然後升級。
Rollback-by-Design:每個動作都有倒退和定時。
6)Ranbooks(Runbooks)和花花公子
Ranbook結構:條件→驗證→動作→驗證→回滾→日誌。
示例:- 在Y國家/地區,PSP故障>X%:切換到B號角,降低「retry_budget」,激活限值緩存,打開PSP的滴答聲。
- Wallet服務中的延遲增長:增加復制副本,加熱Redis密鑰的「限制」,為重型報告啟用「只讀」模式,限制第三方聚合。
7)型號: 從簡單到成熟
1.基本規則和STL季節性:快速開始,幾乎沒有犯規積極性。
2.事件故事的增強模型:「關鍵/子系統」分類器,RCA提示。
3.未解決/深度:用於復雜模式的自動編碼器/隔離森林。
4.Policy-Learning:重制策略培訓(離線模擬+有限的在線實驗)。
重要的是:模型≠魔術。進行回顧性評估,漂移控制,冠軍挑戰者並存儲fici/標簽。
8)A/B和操作實驗
操作解決方案的實驗:不同的撤退/定時策略,PSP路由,連接限制。
成功的度量標準是:MTTR,錯誤預算燒傷,每RPS成本計算,百分比犯規自動記錄。
SLO降解時的停止條件和快速停止。
9)州長,風險和合規性
操作策略:允許的自動化列表、風險區域、更改窗口、批準級別。
審核和跟蹤:何人/何時/為什麼啟動了ranbook;用於驗屍的文物。
PII/PCI:偽裝成膠片/日誌,數據最小化,密碼掃描。
iGaming/fintech監管:決策透明度(explainability),付款停止/限額邏輯必須復制和解釋。
10)工具箱(參考堆棧)
Observability: OpenTelemetry, Prometheus, Grafana/Tempo/Jaeger, Loki/ELK.
目錄和知識:服務目錄,圖依賴性,configs/ficheflags的清單。
ML piplines:功能商店,離線DWH+在線攝影機,寄存器模型,CI/CD模型,漂移監視。
自動化:ranbook編曲器(Argo/StackStorm/自opisnyye),K8s操作員,GitOps(Argo CD/Flux)。
事件:聊天操作(Slack/Telegram/Teams),看門狗,後驗屍模式。
安全性:Vault/KMS,密鑰策略,mTLS,工件簽名。
11) AI-Ops成熟度量
發現:在用戶投訴之前看到的事件百分比;平均提前檢測。
反應:MTTA/MTTR,未升級的自動還原%,RCA質量(精密/反應)。
可靠性:burn-rate, SLO adherence,「噪音」alertes (alerts per-call hour)。
經濟學:節省$計算(rightsizing),減少預算偏差,成本轉換。
文化:驗屍事件比例,Ranbuks服務覆蓋率,規則實施速度。
12)逐步實施計劃
1.遙測和統一信號字典。必備標簽:「服務」,「版本」,「區域」,「合作夥伴」,「api_version」。
2.反噪聲和相關性。重復數據消除、事件分組。
3.Ranbook庫。前10名風險的情景(付款,錢包,遊戲目錄,錦標賽,報告)。
4.主要模型。STL/Prophet+規則;2-3服務飛行員。
5.副駕駛和聊天操作。自然查詢,快速操作,驗屍模式。
6.Gardryls和控制。Canaries,活動限制,審核日誌。
7.實驗和培訓。冠軍挑戰者,A/B,回顧性收益評估。
8.縮放。連接所有關鍵線程、團隊培訓、SLO評論。
13)政治家和configs的例子
13.1自動滑冰政策(想法)
在RPS預測>上周P95+X%時主動滑行。
冷啟動:加熱連接到Redis/PSP,加熱緩存。
停止條件:5xx錯誤在滑冰→回滾後上升。
13.2 Ranbook 「PSP降解」
1.檢查「psp_error_rate> T'和 'region in {BR, TR}」.
2.在PSP-B上啟用僅用於非VIP的智能路由;限制'max_retries=2'。
3.創建PSP-A股票代碼;收集100個RCA查詢/響應。
4.監視CR存款和T2W(時間到錢包)。退化>Y%時回滾。
13.3後驗屍模板(具有自動發生)
檢測器→時間線→假設→影響(用戶/收入)→行動→經驗教訓→ Ranbook/模型更改。
14)反模式
沒有Gardrails的「黑匣子」:機器人在沒有限制和審計的情況下進行銷售。
沒有業務事件數據的模型:看到CPU,但不了解促銷/比賽。
警報風暴:呼叫上的「隧道視覺」→缺乏相關性。
沒有結果/驗證的自動還原。
「永恒的飛行員」:沒有真正行動的出路,只有廉價板。
缺乏驗屍系統-沒有系統培訓。
15) iGaming/fintech背景
負荷峰值(錦標賽,輕量級投註,決賽):謂語滑冰,緩存,PSP限制準備。
負責任的遊戲/限制:沒有合規規則,模型不得自動取消玩家的限制。
監管報告窗口:下載時間表、SLA上載、隊列優先級。
Multi-PSP:跨國家/地區的動態路由,每天的時間,錯誤代碼,交易成本。
VIP部分:單獨的Gardrails-沒有未經確認的侵略性行動(人間循環)。
16)準備就緒清單
1.單層OTel,統一標簽和通過網關的路線。
2.服務和版本依賴性映射(服務主題)。
3.具有模擬和單元測試的ranbook目錄。
4.銷售中至少有一個異常模型+質量報告。
5.能夠讀取邏輯/度量並運行安全操作的聊天副本。
6.Gardryls,金絲雀,回扣,變更審核。
7.根據結果定期進行驗屍和知識/模型更新。
結果
AI-Ops不是「邏輯之上的魔術AI」,而是一門學科:高質量的遙測,易懂的書籍,謹慎的自動化和受控模型。通過引入觀察→理解→操作→學習的循環,您將獲得一個自我修復的平臺,該平臺曾經註意到風險,恢復速度更快,並且使業務成本更低。