فناوری و زیرساخت → AI-Ops و سیستم های خودمختار
AI-Ops و سیستم های مستقل
1) AI-Ops چیست ؟
AI-Ops استفاده از ML/AI به داده های عملیاتی (سیاهههای مربوط، معیارها، مسیرهای پیاده روی، انتشار/حوادث حادثه) به:- شناسایی مشکلات قبل از آن (مقابله با حوادث)،
- اصلاح خودکار
- بهینه سازی هزینه و عملکرد (مقیاس پیش بینی، مسیریابی هوشمند)،
- سرعت بخشیدن به تجزیه و تحلیل حوادث (همبستگی سیگنال، تولید پس از مرگ).
1. احساس (جمع آوری تله متری)،
2. درک (مدل ها، اکتشاف، قوانین)،
3. عمل (ایجاد تغییرات ایمن در محصول توسط ranbooks)،
4. یاد بگیرید (حلقه بازخورد را از طریق تجزیه و تحلیل پس از حادثه ببندید).
2) لایه های معماری AI-Ops
1. مجموعه تله متری (قابلیت مشاهده 3 در 1): معیارهای (Prometheus/OTel)، سیاهههای مربوط (Loki/ELK)، مسیرهای پیاده روی (OTel/Jaeger).
2. غنی سازی و مهندسی ویژگی: تجمع، پنجره های کشویی، فصلی، برچسب های کسب و کار («شریک»، «game _ id»، «منطقه»، «VIP»، «psp»).
- تشخیص ناهنجاری (STL، پیامبر، جنگل انزوا، رمزگذار خودکار)،
- نمودارهای علت و معلول (همبستگی وابستگی)،
- طبقه بندی و اولویت بندی حوادث (قوانین دامنه ML + SRE).
- 4. راه حل ها و اقدامات: کتاب های در حال اجرا، retras خودکار، سوئیچینگ ترافیک، مقیاس خودکار، تغییر محدودیت ها، پیگیری مسیریابی.
- 5. انسان و ماشین مدار: LLM-copylot برای NOC/SRE، دستورات چت، «چه اگر» شبیه سازی.
- 6. فرمانداری و ایمنی: مصوبات، تغییر پنجره ها، شرایط توقف فاجعه بار، ممیزی.
3) منابع و ویژگی های داده
زیرساخت: CPU/حافظه/IO/Latency، خطاهای شبکه، غلاف/گره K8s، محدودیت/درخواست، فشار گره.
خدمات: RPS/P50/P95/P99، 4xx/5xx، اشباع، خطاهای مجدد، حوادث قطع کننده مدار.
سیگنال های کسب و کار: registratsiya → depozit (CR), GGR/خالص سپرده, شکست PSP توسط کد, ترافیک VIP, مسابقات, کمپین های تبلیغاتی.
عوامل اضافی: انتشار/پرچم های ویژگی، گزارش های نظارتی، پنجره های پرداخت بانکی، مسابقات/رویدادها (قله های شرط بندی).
ویژگی های مفید: فصلی هفتگی/ساعتی، عقب ماندگی، آمار نورد، نرخ تغییر، ترکیب خطا با کد، versiya → deltas versiya، نمره اشباع.
4) موارد کاربرد
4. 1- تشخیص زودهنگام حوادث
رشد غیر طبیعی از شکست «psp _ rate _ rate» در منطقه → شکست خودکار به PSP پشتیبان گیری، محدود شده توسط بخش (دست زدن به VIP).
یک الگوی غیر استاندارد از تاخیرهای ردیابی در زنجیره «web → gateway → wallet» → رمزگذاری خودکار ترافیک به غلافهای سالم، گرم کردن حافظه پنهان، راه اندازی مجدد موارد تخریب.
4. 2 مدیریت ظرفیت پیش بینی
پیش بینی RPS، با در نظر گرفتن برنامه بازی و تبلیغی → مقیاس فعال از K8s، گرم کردن اتصالات به پایگاه داده/کش، ابر سهمیه صدور صورت حساب.
صرفه جویی: کاهش بیش از حد اوج در حالی که حفظ SLO.
4. 3 خود درمانی
خطای صف پرداخت → runbook: مکث مصرف کننده، deduplication، فرآیند DLQ، کنترل idemotency.
DB شارد تخریب → تخلیه خواندن، تعویض نویسنده، کارهای پس زمینه را کاهش می دهد.
4. ۴ ارتباط و RCA
ML-خوشه بندی هشدارها (طوفان های هشدار) + نمودارهای سببی → یک «کارت حادثه» به جای ده ها پیام.
تولید خودکار جدول زمانی حادثه و پیش نویس پس از مرگ.
4. 5 کمک خلبان برای NOC/SRE (LLM)
فرمان: «همه چیز را نشان می دهد که 15 دقیقه قبل از افزایش 5xx توسط/v2/پرداخت در منطقه اتحادیه اروپا تغییر کرده است».
پاسخ: پیکربندی های مختلف، یادداشت های انتشار، دلتاهای متریک، غلاف های آسیب دیده، فرضیه ها + دکمه های «شروع ranbook».
5) الگوهای تصمیم گیری
اتوماسیون ایمن: اقدام فقط در «راهرو سبز» (gardrail: حداکثر٪ از ترافیک، حداکثر مقیاس زمین، لیست دستورات مجاز).
انسان در حلقه: مراحل بحرانی (تعویض پایگاه داده اصلی، phicheflags جرم) - با تایید در تماس.
Multisignality: ماشه یک هشدار نیست، بلکه سازگاری است: معیارها + مسیرهای پیاده روی + الگوی ورود به سیستم + علامت انتشار.
اصلاح قناری: ابتدا به 1-5٪ از ترافیک اعمال می شود، سپس تشدید می شود.
Rollback-by-design: هر عمل یک گام به عقب و timeout دارد.
6) Runbooks و playbooks
ساختار Runbook: شرط → تأیید → عمل → اعتبارسنجی → بازگشت → ورود به سیستم.
مثال ها:- PSP چشم پوشی> X٪ در کشور Y: سوئیچ به مسیر B, پایین تر 'retry _ budget', فعال کردن کش حد, بلیط باز به PSP.
- رشد تاخیر در سرویس کیف پول: افزایش کپی، گرم کردن محدودیت های کلید Redis، فعال کردن حالت «فقط خواندنی» برای گزارش های سنگین، محدود کردن جمع آوری های شخص ثالث.
7) مدل ها: ساده تا بالغ
1. قوانین اساسی و فصلی STL: شروع سریع، چند نفر از مردم مثبت.
2. مدل های حادثه تحت نظارت: طبقه بندی بحرانی/زیر سیستم، اشاره RCA.
3. Unsupervised/Deep: جنگل خودکار/جداسازی برای الگوهای پیچیده.
4. سیاست آموزش: آموزش سیاست های اصلاح (شبیه سازی آنلاین + آزمایش آنلاین محدود).
مهم: مدل ≠ سحر و جادو. عقب ماندگی، کنترل رانش، قهرمان رقیب، و حفظ ویژگی ها/برچسب ها.
8) A/B و آزمایش در عملیات
آزمایش بر روی راه حل های عملیاتی: استراتژی های مختلف retray/timeout، مسیریابی PSP، محدودیت اتصال.
معیارهای موفقیت: MTTR، سوزاندن بودجه خطا، هزینه هر RPS،٪ از autofixes عامیانه.
توقف شرایط و توقف سریع در طول تخریب SLO.
9) فرمانداری، ریسک و انطباق
سیاست عمل: فهرست اتوماسیون مجاز، مناطق خطر، پنجره های تغییر، سطح تایید.
ممیزی و ردیابی: چه کسی/چه زمانی/چرا ranbook را راه اندازی کرد ؛ مصنوعات پس از مرگ
PII/PCI: پوشش در ویژگی ها/سیاهههای مربوط، به حداقل رساندن داده ها، اسکن های مخفی.
مقررات iGaming/fintech: شفافیت تصمیمات (قابلیت توضیح)، منطق پرداخت متوقف می شود/محدودیت ها باید قابل تجدید و قابل توضیح باشد.
10) ابزار (پشته مرجع)
قابلیت مشاهده: OpenTelemetry، Prometheus، Grafana/Tempo/Jaeger، Loki/ELK.
کاتالوگ ها و دانش: کاتالوگ خدمات، وابستگی گراف، موجودی configs/phicheflags.
ML-pipeline: ویژگی فروشگاه، ویژگی های آنلاین آفلاین DWH +، مدل ثبت نام، مدل های CI/CD، نظارت بر رانش.
اتوماسیون: هماهنگ کننده ranbooks (Argo/StackStorm/自opisnyye)، اپراتورهای K8s، GitOps (Argo CD/Flux).
حوادث: عملیات چت (Slack/Telegram/Teams)، ربات های تماشا، قالب های پس از مرگ.
امنیت: Vault/KMS، سیاست کلیدی، mTLS، امضای مصنوعی.
11) معیارهای بلوغ AI-Ops
تشخیص: نسبت حوادث دیده شده قبل از شکایت کاربر ؛ سرب تشخیص متوسط.
واکنش: MTTA/MTTR،٪ خودکار اصلاح بدون تشدید، کیفیت RCA (دقت/فراخوان).
قابلیت اطمینان: نرخ سوختن، پایبندی SLO، هشدارها در ساعت تماس.
اقتصاد: صرفه جویی در $ در محاسبات (rightsizing)، کاهش انحراف از بودجه، هزینه هر معامله.
فرهنگ: سهم حوادث با پس از مرگ، پوشش خدمات با runbooks، سرعت اجرای قوانین.
12) طرح پیاده سازی گام به گام
1. دیکشنری تلهمتری و سیگنال یکپارچه (Unified Signal Dictionary) برچسب های مورد نیاز: «سرویس»، «نسخه»، «منطقه»، «شریک»، «api _ version».
2. ضد سر و صدا و همبستگی. تقسیم هشدار، گروه بندی شده توسط حادثه.
3. کتابخونه. سناریوهایی برای 10 ریسک برتر (پرداختها، کیف پول، کاتالوگهای بازی، مسابقات، گزارشها).
4. مدل های اصلی STL/پیامبر + قوانین ؛ خلبان در خدمات 2-3.
5. کمک خلبان و عملیات چت درخواست های طبیعی، اقدامات سریع، قالب های پس از مرگ.
6. گاردریل ها و کنترل قناری ها، محدودیت های عمل، دنباله حسابرسی.
7. آزمایش و آموزش قهرمان رقیب، A/B، ارزیابی سود گذشته نگر.
8. مقیاس پذیری اتصال تمام جریان های بحرانی، تیم های آموزشی، بررسی SLO.
13) نمونه هایی از سیاست ها و پیکربندی ها
13. 1 سیاست مقیاس خودکار (ایده)
مقیاس پیشگیرانه در پیش بینی RPS> + X٪ P95 هفته گذشته.
شروع سرد: گرم کردن اتصالات به Redis/PSP، گرم کردن انبارها.
وضعیت توقف: خطای 5xx پس از skale → rollback رشد می کند.
13. 2 «تخریب PSP» کتاب اجرا
1. «psp _ error _ rate> T» و «منطقه در {BR، TR}» را بررسی کنید.
2. فعال کردن مسیریابی هوشمند در PSP-B فقط برای غیر VIP ؛ limit 'max _ retries = 2'.
3. ایجاد بلیط PSP-A ؛ جمع آوری 100 درخواست/پاسخ برای RCA.
4. نظارت بر CR سپرده و T2W (زمان به کیف پول). بازگشت به تخریب> Y٪.
13. 3 قالب پس از مرگ (autogenerated)
Detector → Timeline → Hypotheses → Impact (Users/Revenue) → Actions → Lessons → Changes to the Runbooks/Models.
14) ضد الگوهای
«جعبه سیاه» بدون gardrails: رباتها حکومت فروش بدون محدودیت و ممیزی.
مدل های بدون داده در رویدادهای کسب و کار: CPU را ببینید، اما تبلیغی/مسابقات را درک نمی کنند.
طوفان های هشدار: عدم همبستگی → در تماس با «دید تونل».
اصلاح خودکار بدون rollback/اعتبار نتیجه.
«خلبانان ابدی»: هیچ راهی برای اقدامات واقعی وجود ندارد، فقط deshboards.
فقدان پس از مرگ - بدون سیستم آموزشی.
15) زمینه iGaming/fintech
قله بار (مسابقات، شرط زندگی می کنند، نهایی): پوسته پوسته شدن پیش بینی، گرم کردن حافظه های نهان، آماده سازی محدودیت PSP.
بازی های مسئول/محدودیت ها: مدل ها نباید محدودیت های بازیکن را به طور خودکار بدون قوانین تطبیق دهند.
پنجره های گزارش نظارتی: برنامه های دانلود، SLA دانلود، اولویت صف.
چند PSP: مسیریابی پویا بر اساس کشور، زمان روز، کدهای خطا، هزینه معامله.
بخش VIP: گاردریل های فردی - بدون اقدامات تهاجمی بدون تأیید (انسان در حلقه).
16) چک لیست آمادگی
1. یک لایه واحد OTel، برچسب ها و آهنگ های یکپارچه از طریق دروازه.
2. توپولوژی خدمات
3. کاتالوگ کتاب های اجرا با شبیه سازی و تست واحد.
4. حداقل یک مدل از ناهنجاری ها در گزارش محصول + کیفیت.
5. کمک خلبان چت قادر به خواندن سیاهههای مربوط/معیارها و راه اندازی اقدامات امن.
6. گاردریل ها، قناری ها، ضربات، ممیزی ها را تغییر دهید.
7. به طور منظم پس از مرگ و به روز رسانی دانش/مدل بر اساس نتایج.
نتیجه گیری
AI-Ops یک «AI جادویی در بالای سیاهههای مربوط» نیست، بلکه یک رشته است: تله متری با کیفیت بالا، ranbooks قابل فهم، اتوماسیون محتاطانه و مدل های کنترل شده. با معرفی یک حلقه مشاهده → درک → عمل → یادگیری با گاردریل روشن، شما یک پلت فرم خود شفا که متوجه خطرات زودتر، بهبود سریع تر و هزینه های کسب و کار کمتر است.