التكنولوجيا والبنية التحتية → عمليات الذكاء الاصطناعي والأنظمة المستقلة
AI-Ops والأنظمة المستقلة
1) ما هو الذكاء الاصطناعي
AI-Ops هو تطبيق ML/AI على البيانات التشغيلية (السجلات والمقاييس والمسارات وأحداث الإطلاق/الحادث) من أجل:- اكتشاف المشاكل في وقت سابق (المواقف المضادة للحوادث)،
- الإصلاح التلقائي
- تحسين التكلفة والأداء (التوسع التنبؤي، والتوجيه الذكي)،
- الإسراع بتحليل الحوادث (ارتباط الإشارة، توليد تشريح الجثة).
1. الشعور (جمع القياس عن بعد)،
2. فهم (النماذج، الاستدلال، القواعد)،
3. الفعل (إجراء تغييرات آمنة في المنتج عن طريق دفاتر الفاتورة)،
4. تعلم (قم بإغلاق حلقة التغذية الراجعة من خلال تحليلات ما بعد الحادث).
2) طبقات بنية الذكاء الاصطناعي
1. مجموعة القياس عن بعد (إمكانية الرصد 3 في 1): مقاييس (بروميثيوس/أوتيل)، سجلات (لوكي/إلك)، مسارات (أوتيل/جايجر).
2. هندسة الإثراء والميزات: التجميعات، النوافذ المنزلقة، الموسمية، علامات الأعمال ("شريك"، "game _ id'،" منطقة "،" VIP "،" psp ").
- الكشف عن الشذوذ (STL، Prophet، Isolation Forest، auto encoders)،
- الرسوم البيانية للسبب والنتيجة (ارتباطات التبعية)،
- تصنيف الحوادث وترتيب أولوياتها (قواعد نطاق ML + SRE).
- 4. الحلول والإجراءات: تشغيل الكتب، والسحب التلقائي، وتبديل حركة المرور، والتحجيم التلقائي، وتغيير الحدود، والمتابعة.
- 5. دائرة الآلة البشرية: LLM-copylot لـ NOC/SRE، أوامر الدردشة، محاكاة «ماذا لو».
- 6. الحاكم والسلامة: الموافقات، نوافذ التغيير، ظروف التوقف الكارثية، التدقيق.
3) مصادر البيانات وميزاتها
البنية التحتية: وحدة المعالجة المركزية/الذاكرة/IO/Latency، أخطاء الشبكة، K8s القرون/العقد، الحدود/الطلبات، ضغط العقدة.
الخدمات: RPS/P50/P95/P99، 4xx/5xx، التشبع، أخطاء إعادة الدرج، أحداث قاطع الدائرة.
إشارات الأعمال: registratsiya→depozit (CR)، GGR/Net Deposits، فشل PSP بالرمز، حركة المرور لكبار الشخصيات، البطولات، الحملات الترويجية.
عوامل إضافية: الإصدارات/أعلام الميزات، التقارير التنظيمية، نوافذ الدفع المصرفية، المباريات/الأحداث (ذروة الرهان).
الميزات المفيدة: الموسمية الأسبوعية/في الساعة، التأخير، الإحصائيات المتدحرجة، معدل التغيير، مزيج الخطأ بالرموز، دلتا versiya→versiya، درجة التشبع.
4) حالات الطلب
4. 1 الكشف المبكر عن الحوادث
النمو غير الطبيعي لفشل «psp _ disclution _ rate» في المنطقة → فشل تلقائي في PSP احتياطي، محدود بالقطاعات (لا يمس VIP).
هناك نمط غير قياسي من التأخيرات النزرة في سلسلة «بوابة → الويب → المحفظة» → حركة المرور التشفيرية التلقائية إلى القرون الصحية، وتسخين ذاكرة التخزين المؤقت، وإعادة تشغيل الحالات المهينة.
4. 2 إدارة القدرات التنبؤية
توقعات RPS، مع الأخذ في الاعتبار جداول المطابقة والترويج → التوسع الاستباقي K8s، وتسخين الاتصالات بقاعدة البيانات/ذاكرة التخزين المؤقت، وحصص الفوترة السحابية.
المدخرات: خفض الحجم الزائد خارج الذروة مع الحفاظ على SLO.
4. 3 الشفاء الذاتي
خطأ في قائمة انتظار المدفوعات العالقة → كتاب التشغيل: توقف المستهلك مؤقتًا، والتفريغ، وعملية DLQ، والتحكم في الخصوصية.
شارد متدهور DB → إخلاء القراءات، تبديل الكاتب، خنق وظائف الخلفية.
4. 4 الارتباط و RCA
تجميع التنبيهات (عواصف التنبيه) + الرسوم البيانية السببية → «بطاقة حوادث» واحدة بدلاً من عشرات الرسائل.
التوليد التلقائي للجدول الزمني للحوادث ومسودة تشريح الجثة.
4. 5 Copilot for NOC/SRE (LLM)
الأمر: «أظهر كل ما تغير قبل 15 دقيقة من ارتفاع 5xx بواسطة/v2/المدفوعات في منطقة الاتحاد الأوروبي».
الإجابة: تكوينات diff، ملاحظات الإصدار، دلتا مترية، قرون متأثرة، فرضيات + أزرار «رانبوك بدء».
5) أنماط القرار
التشغيل الآمن للأتمتة: العمل فقط في «الممر الأخضر» (gardrail: max٪ من حركة المرور، max scale pitch، قائمة الأوامر المسموح بها).
Human-in-the-loop: خطوات حرجة (تبديل قاعدة البيانات الرئيسية، phicheflags الكتلة) - مع تأكيد عند الطلب.
الإشارات المتعددة: المشغل ليس تنبيهًا واحدًا، ولكن الاتساق: المقاييس + المسارات + نمط السجل + علامة الإطلاق.
علاج الكناري: ينطبق أولاً على 1-5٪ من حركة المرور، ثم يتصاعد.
التراجع عن طريق التصميم: لكل إجراء خطوة إلى الوراء ووقت مستقطع.
6) كتب التشغيل وكتب اللعب
هيكل كتيب التشغيل: الشرط → التحقق من الإجراء → → التحقق → التراجع → السجل.
أمثلة:- تنازل PSP> X٪ في البلد Y: التبديل إلى المسار B، أقل «إعادة تجربة _ ميزانية»، تنشيط ذاكرة التخزين المؤقت، فتح تذكرة إلى PSP.
- نمو زمن الوصول في خدمة المحفظة: زيادة النسخ المتماثلة، وإحماء «حدود» مفاتيح Redis، وتمكين وضع «القراءة فقط» للتقارير الثقيلة، والحد من تجميعات الأطراف الثالثة.
7) النماذج: بسيطة إلى ناضجة
1. القواعد الأساسية وموسمية STL: بداية سريعة، القليل من الإيجابيات الشعبية.
2. نماذج تاريخ الحوادث الخاضعة للإشراف: تصنيف الحرجية/النظام الفرعي، تلميح RCA.
3. Unsupervised/Deep: Autencoder/Isolation Forest for complex stands.
4. تعلم السياسات: تدريب سياسات الإصلاح (محاكاة خارج الإنترنت + تجارب محدودة على الإنترنت).
مهم: نماذج ≠ السحر. قم بالإدراك المتأخر، والتحكم في الانجراف، والمنافس البطل، واحتفظ بالميزات/الملصقات.
8) ألف/باء والتجريب في العمليات
التجارب على الحلول التشغيلية: استراتيجيات إعادة/مهلة مختلفة، توجيه PSP، حدود الاتصال.
مقاييس النجاح: MTTR، حرق ميزانية الخطأ، التكلفة لكل RPS،٪ من الخلاصات الذاتية الشعبية.
توقف عن الظروف وتوقف بسرعة أثناء تدهور SLO.
9) منصب الحاكم والمخاطر والامتثال
سياسة العمل: قائمة الأتمتة المسموح بها، مناطق المخاطر، نوافذ التغيير، مستويات الموافقة.
مراجعة الحسابات والتعقب: من/متى/لماذا أطلق دفتر المرافئ ؛ القطع الأثرية لتشريح الجثة
PII/PCI: إخفاء الميزات/السجلات، وتقليل البيانات، والمسح السري.
لائحة iGaming/fintech: شفافية القرارات (قابلية التفسير)، يجب أن يكون منطق توقف/حدود الدفع قابلاً للتكرار ويمكن تفسيره.
10) الأدوات (مكدس مرجعي)
إمكانية الرصد: OpenTelemetry، Prometheus، Grafana/Tempo/Jaeger، Loki/ELK.
الكتالوجات والمعارف: فهرس الخدمات، اعتماد الرسم البياني، جرد التكوينات/phicheflags.
خطوط أنابيب ML: متجر الميزات، ميزات DWH + عبر الإنترنت، سجل الطراز، طرازات CI/CD، مراقبة الانجراف.
التشغيل الآلي: منظم لكتب الران (Argo/StackStorm/自opisnyye)، مشغلي K8s، GitOps (Argo CD/Flux).
الحوادث: عمليات الدردشة (Slack/Telegram/Teams)، روبوتات المراقبة، قوالب ما بعد الوفاة.
الأمان: Vault/KMS، سياسة المفتاح، mTLS، توقيع القطع الأثرية.
11) مقاييس نضج AI-Ops
الكشف: نسبة الحوادث التي شوهدت قبل شكاوى المستعملين ؛ متوسط الرصاص للكشف.
رد الفعل: MTTA/MTTR،% العلاج التلقائي بدون تصعيد، جودة RCA (الدقة/الاستدعاء).
الموثوقية: معدل الحرق، التزام SLO، تنبيهات لكل ساعة عند الطلب.
الاقتصاد: توفير الدولار على الحسابات (الحجم الصحيح)، وتقليل الانحرافات عن الميزانية، والتكلفة لكل معاملة.
الثقافة: تقاسم الحوادث مع تشريح الجثة، وتغطية الخدمات بالكتيبات، وسرعة تنفيذ القواعد.
12) خطة التنفيذ خطوة بخطوة
1. القياس عن بعد وقاموس الإشارة الموحدة. الملصقات المطلوبة: «خدمة»، «إصدار»، «منطقة»، «شريك»، «نسخة api _».
2. مكافحة الضوضاء والارتباط. تنبيه إسقاط، مصنفة حسب الحادث.
3. مكتبة كتاب التشغيل. سيناريوهات لأهم 10 مخاطر (المدفوعات، المحفظة، كتالوجات الألعاب، البطولات، التقارير).
4. النماذج الأولية. قواعد STL/Prophet + ؛ على الخدمات 2-3.
5. المساعد وعمليات الدردشة. طلبات طبيعية، إجراءات سريعة، قوالب ما بعد الوفاة.
6. الحدائق والسيطرة. جزر الكناري، حدود العمل، مسار التدقيق.
7. التجارب والتدريب. بطل-منافس، A/B، تقييم الفوائد بأثر رجعي.
8. التحجيم. ربط جميع التدفقات الحرجة، فرق التدريب، مراجعة SLO.
13) أمثلة على السياسات والتشكيلات
13. 1 سياسة القياس التلقائي (فكرة)
التوسع الاستباقي في توقعات RPS> + X٪ P95 الأسبوع الماضي.
البداية الباردة: تسخين الاتصالات بـ Redis/PSP، وتسخين المخابئ.
حالة التوقف: ينمو خطأ 5xx بعد التراجع عن →.
13. 2 كتيب تشغيل «تحلل PSP»
1. Check 'psp _ error _ rate> T' and 'region in {BR, TR}'.
2. تمكين التوجيه الذكي على PSP-B لغير كبار الشخصيات فقط ؛ الحد «max _ retries = 2».
3. إنشاء تذكرة PSP-A ؛ جمع 100 طلب/رد من أجل التقييم التعاوني الإقليمي.
4. رصد إيداع T2W CR (وقت المحفظة). التراجع عن التحلل> Y٪.
13. 3 قالب ما بعد الوفاة (متجدد ذاتيًا)
Detector → Timeline → Hypotheses → Impact (Users/Revenue) → Actions → Lessons → Changes to the Runbooks/Models.
14) الأنماط المضادة
«الصندوق الأسود» بدون غاردرايل: الروبوتات تحكم البيع دون حدود وتدقيق.
نماذج بدون بيانات عن الأحداث التجارية: انظر وحدة المعالجة المركزية، ولكن لا تفهم الترويج/المطابقة.
عواصف تنبيه: عدم وجود علاقة → «رؤية النفق» تحت الطلب.
الإصلاح التلقائي دون التراجع/التحقق من صحة النتيجة.
«الطيارون الأبديون»: لا يوجد مخرج للأفعال الحقيقية، فقط ألواح الخلع.
عدم وجود تشريح الجثة - لا يوجد نظام تدريب.
15) سياق iGaming/fintech
قمم التحميل (البطولات، الرهانات الحية، النهائيات): التوسع التنبؤي، تسخين المخابئ، إعداد حدود PSP.
الألعاب/الحدود المسؤولة: يجب ألا ترفع النماذج حدود اللاعب تلقائيًا دون مطابقة القواعد.
نوافذ الإبلاغ التنظيمية: جداول التنزيل، تنزيل SLAs، أولوية قائمة الانتظار.
متعدد PSP: التوجيه الديناميكي حسب البلد، والوقت من اليوم، ورموز الخطأ، وتكلفة المعاملة.
مقطع VIP: الحدائق الفردية - لا توجد إجراءات عدوانية دون تأكيد (الإنسان في الحلقة).
16) قائمة الجاهزية المرجعية
1. طبقة واحدة من OTel، ملصقات ومسارات موحدة عبر البوابة.
2. طوبولوجيا الخدمة.
3. فهرس الدفاتر مع المحاكاة واختبارات الوحدة.
4. نموذج واحد على الأقل من الحالات الشاذة في تقرير جودة المنتج +.
5. مساعد الدردشة القادر على قراءة السجلات/المقاييس وإطلاق إجراءات آمنة.
6. غاردرايل، كناري، رشاوى، تغيير عمليات التدقيق.
7. تشريح المعارف/النماذج وتحديثها بانتظام استنادا إلى النتائج.
النتيجة
AI-Ops ليست «ذكاء اصطناعي سحري فوق السجلات»، ولكنها تخصص: قياس عن بعد عالي الجودة، وكتب رانات مفهومة، وأتمتة حذرة ونماذج خاضعة للرقابة. من خلال تقديم حلقة من مراقبة الفهم → → العمل → التعلم مع الحدائق الواضحة، تحصل على منصة للشفاء الذاتي تلاحظ المخاطر في وقت مبكر، وتتعافى بشكل أسرع وتكلف العمل أقل.