Logo GH

استقرار مدل های ML

(بخش: تکنولوژی و زیرساخت)

خلاصه ای کوتاه

استقرار تولید ML قابل اعتماد مجموعه ای از است: مصنوعات تکرار (مدل/tokenizer/config)، گشت و گذار استاندارد (Triton/KServe/vLLM)، فرایند انتشار امن (قناری/آبی سبز/سایه)، قابلیت مشاهده (تاخیر، کیفیت، رانش) و runbooks در حوادث. تأخیر کم (ضد تقلب/شخصی سازی)، SLO دقیق، PII/انطباق و کنترل هزینه برای iGaming بسیار مهم است.

1) حالت های استقرار

دسته ای (آفلاین): وظایف شب/ساعت (به ثمر رساند گذشته نگر، به روز رسانی بخش). ارزان، قابل پیش بینی

آنلاین (API همزمان): ضد تقلب، شخصی سازی، توصیه ها، راهنمایی LLM. نیاز به P95 SLA (به عنوان مثال، ≤ 100-300 میلی ثانیه).
جریان (نزدیک به زمان واقعی): پنجره های 1-60 ثانیه (Flink/Spark/Kafka Streams) برای سیگنال ها و محرک های CRM.
ترکیبی: آنلاین سریع نمره خشن + محاسبه مجدد آنلاین/کالیبراسیون.

2) مصنوعات و بسته بندی

مصنوعات مدل: وزن، نشانه گذاری، تنظیمات پیش پردازش/پس پردازش، نسخه مجموعه داده/کد.
فرمت ها: PyTorch/TF SavedModel، ONNX برای سازگاری، موتور TensorRT برای شتاب، GGUF/awq/gptq برای کمیت LLM.
ظروف: تصاویر OCI Docker با وابستگی های پین شده ؛ برچسب های چند پلت فرم (CPU/GPU).
انتشار غیر قابل تغییر: برچسب زدن 'مدل: fraud-v3. 2. 1 '،' تصویر: تقلب: 3. 2. 1`.

3) پلت فرم خدمت

تریتون استنتاج سرور: چند مدل، بوچینگ پویا، گروه خطوط لوله.
KServe (K8s-native): مقیاس خودکار (HPA/KPA)، canary/shadow، زمان اجرا خود.
vLLM/TGI (LLM): دسته بندی مداوم، حافظه پنهان KV، رمزگشایی احتمالی.
Fichestor: آنلاین (ms-SLA) + آفلاین برای برابری ویژگی.

مثال KServe-canary (ایده):
yaml apiVersion: serving. kserve. io/v1beta1 kind: InferenceService metadata: { name: fraud }
spec:
predictor:
canaryTrafficPercent: 15 model:
modelFormat: { name: triton }
storageUri: s3://models/fraud/v3. 2. 1/
resources: { limits: { nvidia. com/gpu: "1" } }

4) استراتژی های انتشار

آبی سبز: دو پشته یکسان، تعویض ترافیک فوری، بازگشت ساده.
Canary: افزایش تدریجی ترافیک (1٪ → 5٪ → 25٪ → 100٪) در سراسر دروازه های SLO/کیفیت.
سایه: مدل جدید یک کپی از ترافیک را دریافت می کند، پاسخ ها هیچ چیز را تحت تاثیر قرار نمی دهند - برآورد امن.
تست A/B: ما معیارهای کسب و کار (تبدیل، نگهداری)، اهمیت آماری را اندازه گیری می کنیم.

مثال قوانین مسیریابی (pseudo-NGINX):

map $request_id $route {
default old;
"~ canary" new; # 5-15% by flag/cook/feature-toggle
}

5) SLO ها و بودجه های عملیاتی

ضد تقلب/شخصی سازی آنلاین: p95 ≤ 100-150 میلی ثانیه، p99 ≤ 250-400 میلی ثانیه.
نکات LLM (128-512 نشانه): تولید p95 ≤ 300-800 میلی ثانیه از اولین نشانه ها، نشانه ها/هدف ≥.
دسترسی: ≥ 99 9٪ برای مسیرهای بحرانی.
کیفیت: AUC/PR-AUC/Top-K @ N آستانه ≥ ؛٪ پاسخ سمی/نادرست ≤ X.
هزینه: درخواست $/1k یا $/1k نشانه - در بودجه.

6) CI/CD برای مدل ها

نوار نقاله:

1. Train/finetune → model در رجیستری (ابرداده: داده/کد/معیارها/مجوزها).

2. بسته و اعتبار: تست واحد قبل/پست، سازگاری API، تست بار (تاخیر/نشانه/ها).

3. قناری استقرار: 1-5٪ ترافیک ؛ قابلیت مشاهده (SLO/کیفیت/هزینه).

4. ترویج/بازگشت توسط دروازه معیار.

نمونه ای از یک قطعه از اقدامات GitHub (ایده):
yaml jobs:
build-serve:
steps:
- run: make export_onnx && make docker_build
- run: pytest tests/serve --maxfail=1
- run: python perf_check. py --p95 120 --fail-on-regress
- run: kubectl apply -f kserve-canary. yaml

7) بهینه سازی تاخیر و توان

Triton/vLLM، درخواست همزمان، قبل/بعد از پردازش در CPU.
کوانتیزاسیون (INT8/FP8/INT4) با کالیبراسیون ؛ کامپایل زمان اجرا TensorRT/ONNX.
ذخیره سازی: ویژگی (آنلاین ویژگی/Redis)، نتایج و حافظه پنهان KV برای LLM.
گرم شدن: گرم کردن مقیاس/انبارها در طول تخلیه ؛ «گرم» اجاق autoscale.
بودجه زمان: توقف زودهنگام، محدودیت توکن/پرتو، سازگاری دما.

8) قابلیت مشاهده: تله متری، رانش، کیفیت

معیارهای SRE: RPS، p50/p95/p99، خطاها (5xx/4xx)، GPU/CPU util، حافظه، صف، پر کردن دسته.
معیارهای ML: AUC/PR-AUC، خطای کالیبراسیون، پوشش، نشانه ها، طول پاسخ، ضربه کش.

رانش: اختلاف PSI/JS توسط ورودی ها/ویژگی ها، نظارت بر تغییر توزیع ؛ هشدار ها

کیفیت آنلاین: موارد تست طلا، نمونه برداری پاسخ، سمیت خودکار RAG-score/LLM.
ورود به سیستم: سریع/پاسخ (ناشناس)، trace_id، نسخه مدل.

مثال پرومتئوس (ایده):

inference_latency_ms_bucket{model="fraud-v3. 2. 1",le="100"} 12345 inference_qps{model="fraud-v3. 2. 1"} 450 tokens_per_second{model="llm-help-v1"} 210

9) مدیریت ویژگی و سازگاری

ویژگی برابری: همان تحولات آفلاین/آنلاین ؛ نسخه به عنوان کد ارائه می شود.
fichestor آنلاین: ms-SLA، TTL، upsert، idempotency ؛ کش نزدیک تر به گشت و گذار.
Backfill/refresh: برنامه ای برای حفظ امتیاز آنلاین از واگرایی از معیارهای آفلاین.

10) امنیت، PII و مجوزها

PII: tokenization/masking، تقسیم بندی بر اساس منطقه (EU/TR/LATAM)، رمزگذاری در حالت استراحت/در حمل و نقل.
اسرار/کلید: مدیریت KMS/اسرار، هیچ اسرار در تصاویر.
سیاست های LLM: فیلتر محتوا، درپوش امن، قرمز تیم.
مجوزها: بررسی شرایط برای مجموعه داده/وزن، ممنوعیت توزیع مجدد/تجارت.
جداسازی: namespace-RBAC، سهمیه، tains/tolerations برای استخرهای GPU.

11) مقیاس خودکار و QoS

خودکار سازی: توسط RPS/صف/تاخیر/GPU-util ؛ min-ready-pods برای خطوط تلفن.
کلاس های QoS: آنلاین انتقادی (ضد تقلب)> LLM چت> آزمایش. پیشگیری به نفع انتقادی.
چند منطقه: مسیریابی مبتنی بر تأخیر، کش های وزن گرم شده، تکرار ویژگی.

12) اجرا و حوادث

رشد P99: چک کردن دسته پر، صف، GPU-util، حافظه پنهان ؛ فعال کردن butching تهاجمی/پرتو پایین/نشانه.
کیفیت سقوط کرد: بازگشت به نسخه قبلی، روشن کردن سایه، تعمیر منابع رانش.
هزینه در حال رشد است: فعال quantization/TensorRT، افزایش دسته ای، بهینه سازی ویژگی/کش، کاهش فرکانس نسل LLM از طریق کش RAG/نتیجه.
حادثه PII: توقف فوری خط، فراخوان مصنوعی، ممیزی دسترسی، گزارش روش به تنظیم کننده.

13) قالب نمونه

تریتون - دسته بندی پویا (قطعه):
text dynamic_batching { preferred_batch_size: [4, 8, 16, 32]
max_queue_delay_microseconds: 2000 }
instance_group { kind: KIND_GPU count: 2 }
راه اندازی vLLM (ایده ها):

--tensor-parallel-size 2
--max-num-seqs 512
--gpu-memory-utilization 0. 9
بررسی سازگاری API (کد شبه):
python resp = client. score({"features": f}) # v3. 2. 1 assert set(resp. keys()) >= {"score","version","latency_ms"}

14) چک لیست پیاده سازی

1. SLO/SLA (تاخیر/در دسترس بودن/کیفیت/هزینه) را تعریف کنید.
2. استاندارد مصنوعات و رجیستری مدل (نسخه ها، ابرداده).
3. یک پشته خدمت (Triton/KServe/vLLM) و یک فیکستر را انتخاب کنید.
4. راه اندازی قناری/آبی سبز/سایه و دروازه های اتوماتیک.
5. ساخت CI/CD: تست سازگاری، رگرسیون perf، ارتقاء امن.
6. شامل قابلیت مشاهده (معیارهای SRE + ML)، نظارت بر رانش و هشدارها.
7. ارائه PII/امنیت/مجوز و حسابرسی.
8. پیکربندی مقیاس خودکار/QoS و سیاست های چند منطقه ای.
9. کتاب اجرا را آماده کنید و یک روز بازی داشته باشید.
10. مدیریت هزینه را وارد کنید: butching، quantization، cache، RAG.

15) ضد گلوله

استقرار «همانطور که هست» بدون canary/observability → حوادث غیر منتظره.
ناسازگار آفلاین/ویژگی های آنلاین → اختلاف متریک.
عدم وجود آزمون perf و محدودیت → p99 «شناور».
ثبت درخواست/پاسخ بدون ناشناس → خطر PII.
یک استخر GPU مشترک برای همه چیز بدون QoS → بحرانی آنلاین رنج می برد.
هیچ عقبگرد و عکس های فوری از مصنوعات → خرابی طولانی وجود دارد.

خلاصه

استقرار موفقیت آمیز از مدل های ML مصنوعات containerized، خدمت استاندارد، یک فرایند انتشار امن (قناری/آبی سبز/سایه)، SLOs سخت، و کیفیت/رانش/هزینه مشاهده. اضافه کردن fichestore، CI/CD با دروازه های perf، بهداشت PII، autoscale و QoS - و خدمات ضد تقلب/شخصی/LLM شما به طور مداوم بارهای iGaming اوج را حفظ می کند در حالی که در p99 و بودجه قابل پیش بینی است.

Contact

با ما در تماس باشید

برای هرگونه سؤال یا نیاز به پشتیبانی با ما ارتباط بگیرید.ما همیشه آماده کمک هستیم!

Telegram
@Gamble_GC
شروع یکپارچه‌سازی

ایمیل — اجباری است. تلگرام یا واتساپ — اختیاری.

نام شما اختیاری
ایمیل اختیاری
موضوع اختیاری
پیام اختیاری
Telegram اختیاری
@
اگر تلگرام را وارد کنید — علاوه بر ایمیل، در تلگرام هم پاسخ می‌دهیم.
WhatsApp اختیاری
فرمت: کد کشور و شماره (برای مثال، +98XXXXXXXXXX).

با فشردن این دکمه، با پردازش داده‌های خود موافقت می‌کنید.