Logo GH

פריסת דגמי ML

(סעיף: טכנולוגיה ותשתיות)

תקציר

פריסת ייצור אמינה (באנגלית: Eministrative ML production Pression Pression Preservation Pression) היא אוסף של חפצים שניתן לחזור עליהם (מודל/טוקניזר/קונפיג), גלישה סטנדרטית (Triton/KServe/vLLM), תהליך שחרור. Latency (אנטי-הונאה/פרסונליזציה), SLO קפדני, PII/ציות ובקרה עלויות הם קריטיים עבור iGaming.

1) מצבי פריסה

חבטה (לא מקוון): משימות לילה/שעה (ניקוד רטרוספקטיבה, עדכון מקטעים). זול, צפוי.
אונליין (API סינכרוני): אנטי-הונאה, התאמה אישית, המלצות, עצות בע "מ. דורש p95 SLA (לדוגמה, 100-300 ms).
זרם (כמעט בזמן אמת): 1-60 שניות חלונות (Flink/Spark/Kafka Streams) עבור אותות CRM והפעילים.
היברידי: ציון גס מהיר מקוון + חישוב/כיול מחדש.

2) חפצים ואריזות

פריטי מודל: משקולות, תמצית, עיבוד מראש/הגדרות פוסטפרודוקציה, גרסת נתונים/קוד.
פורמטים: PyTorch/TF Model, ONNX לתאימות, Tensort-Engine לתאוצה, GGUF/awq/gptq לקוונטיזציה של LLM.
מיכלים: Docker OCI תמונות עם תלויות תקועות; תגיות מולטי-פלטפורמות (CPU/GPU).
שחרורים בלתי ניתנים לתיוג: מודל הונאה-v3. 2. 1 ',' תמונה: הונאה: 3. 2. 1`.

3) פלטפורמת הגשה

Triton Inference Server: רב-מודל, חבטות דינמיות, אנסמבל צינורות.
KServe (K8s-native): קנה מידה אוטומטי (HPA/KPA), צל/כנרי, זמן ריצה משלו.
VLLM/TGI (LLM): חבורה רציפה, מטמון KV, פענוח ספקולטיבי.
פיכסטור: מקוון (ms-SLA) + לא מקוון עבור זוגיות תכונה.

דוגמה של KServe-canary (רעיון):
yaml apiVersion: serving. kserve. io/v1beta1 kind: InferenceService metadata: { name: fraud }
spec:
predictor:
canaryTrafficPercent: 15 model:
modelFormat: { name: triton }
storageUri: s3://models/fraud/v3. 2. 1/
resources: { limits: { nvidia. com/gpu: "1" } }

4) אסטרטגיות שחרור

שתי ערימות זהות, החלפת תנועה מיידית, החלפה פשוטה.
Canary: מגדיל באופן הדרגתי את התנועה (1% = 5% = 25% = 100%) על פני שערי SLO/איכות.
צל: המודל החדש מקבל עותק של התנועה, התגובות לא משפיעות על שום דבר - הערכה בטוחה.
מבחני A/B: אנו מודדים מדדים עסקיים (המרה, שימור), משמעות סטטיסטית.

דוגמה לחוקי ניתוב (פסאודו-NGINX):

map $request_id $route {
default old;
"~ canary" new; # 5-15% by flag/cook/feature-toggle
}

5) תקציבי SLOS ותפעול

אונליין נגד הונאה/פרסונליזציה: p95 יומן 100-150 ms, p99 יומן 250-400 ms.
רמזים LLM (128-512 אסימונים): p95 מדור 300-800 של האסימונים הראשונים, אסימונים/ים.
זמינות: 99. 9% עבור מסלולים קריטיים.
איכות: AUC/PR-UCUC/Top-K @ N @ סף;% תגובות רעילות/שגויות LOX.
עלות: בקשות $/1k או אסימונים $1k - בתוך תקציב.

6) CI/CD למודלים

מסוע:

1. Train/finetune # model in the registry (metadata: data/code/metrics/rשיונות).

2. חבילת & תוקף: בדיקות יחידה טרום/פוסט, תאימות API, בדיקות טעינה (latency/skens/s).

3. פריסה קנרית: 1-5% תנועה; יכולת תצפית (SLO/איכות/עלות).

4. לקדם/Rollback לפי קריטריונים שערים.

דוגמה לקטע של GitHub Actions (רעיון):
yaml jobs:
build-serve:
steps:
- run: make export_onnx && make docker_build
- run: pytest tests/serve --maxfail=1
- run: python perf_check. py --p95 120 --fail-on-regress
- run: kubectl apply -f kserve-canary. yaml

7) אופטימיזציה של עיכוב ותפקוד

Triton/vLLM, מבקש עיבוד מקביל, מראש/פוסט-עיבוד במעבד.
קוונטיזציה (INT8/FP8/INT4) בעזרת כיול; הידור זמן ריצה TensorRT/ONNX.
מטמון: תכונה (תכונה מקוונת/רדיס), תוצאות ומטמון KV עבור LLM.
חימום: חימום הקשקשים/מטמונים במהלך השלכת; לבבות ”חמים” אוטוסקאלה.
תקציב זמן: עצירה מוקדמת, גבול סמלי/קרן, הסתגלות טמפרטורה.

8) יכולת תצפית: טלמטריה, סחף, איכות

מטרי SRE: RPS, p50/p95/p99, שגיאות (5xx/4xx), GPU/CPU util, זיכרון, תור, אצווה-מילוי.
מטרי ML: AUC/PR-AUC, שגיאת כיול, כיסוי, אסימונים/S, אורך תגובה, פגיעה במטמון.
סחיפה: סטייה של PSI/JS על ידי קלט/תכונות, ניטור שינוי תפוצה; התראות.
איכות מקוונת: מקרי בדיקת זהב, דגימת תשובה, ציון אוטומטי של RAG/LLM רעילות.
רישום: prompt/response (אנונימי), trace_id, גרסת מודל.

פרומתאוס דוגמה (רעיון):

inference_latency_ms_bucket{model="fraud-v3. 2. 1",le="100"} 12345 inference_qps{model="fraud-v3. 2. 1"} 450 tokens_per_second{model="llm-help-v1"} 210

9) ניהול מאפיינים ועקביות

זוגיות-תכונה: אותן טרנספורמציות לא מקוונות/מקוונות; תכונות גרסה כקוד.
פיכסטור מקוון: ms-SLA, TTL, upsert, idempotency; מטמון קרוב יותר לגלישה.
תוכנית לשמור על ניקוד מקוון מפני סטייה ממדדים לא מקוונים.

10) אבטחה, מח "ש ורישיונות

PII: tokenization/masking, segmentation by region (EU/TR/LATAM), הצפנה במנוחה/במעבר.
סודות/מפתחות: KMS/Secrets Manager, ללא סודות בתמונות.

מדיניות LLM: מסנני תוכן, מנעולים בטוחים,

רישיונות: בדוק תנאים עבור נתונים/משקלים, איסורים על חלוקה מחדש/מסחר.
בידוד: RBAC-Name-RABACE, מכסות, מגעים/סובלנות לבריכות GPU.

11) אוטוסקלה ו ־ QOS

גלישה אוטומטית: על ידי RPS/תור/latency/GPU-util; תרמילי מין מוכנים לקווים חמים.
שיעורי QOS: ביקורתי מקוון (אנטי-הונאה)> LLM צ 'אט> ניסויים. הקדמה לטובת הקריטי.
ניתוב רב-תחומי, מטמונים בעלי משקל מחומם, שכפול תכונה.

12) ספרי ריצות ותקריות

צמיחת פי-99: בדוק מילוי-אצווה, תור, GPU-util, מטמון מתגעגע; אפשר חבטה אגרסיבית/קרן תחתונה/אסימונים.
איכות נפלה: להתגלגל לגרסה הקודמת, להפעיל צל, לתקן את מקורות הסחף.
העלות גדלה: אפשר קוונטיזציה/TensorRT, להגביר אצווה, לייעל תכונה/מטמון, להפחית את התדירות של דורות LLM באמצעות מטמון RAG/תוצאה.
תקרית מח ”ש: עצירה מיידית של הקו, החזרת חפץ, ביקורת גישה, דו” ח הליך לווסת.

13) תבניות לדוגמה

טריטון - חבורה דינמית (שבר):
text dynamic_batching { preferred_batch_size: [4, 8, 16, 32]
max_queue_delay_microseconds: 2000 }
instance_group { kind: KIND_GPU count: 2 }
השקת VLLM (רעיונות):

--tensor-parallel-size 2
--max-num-seqs 512
--gpu-memory-utilization 0. 9
בדיקת תאימות API (פסאודו קוד):
python resp = client. score({"features": f}) # v3. 2. 1 assert set(resp. keys()) >= {"score","version","latency_ms"}

14) רשימת מימושים

1. הגדר SLO/SLA (latency/זמינות/איכות/עלות).
2. תקן חפצים ורישום דגמים (גרסאות, metadata).
3. בחר ערימת הגשה (טריטון/KServe/vLLM) ופיצ 'סטר.
4. הגדרת קנריות/כחול ירוק/צל ושערים אוטומטיים.
5. לבנות CI/CD: בדיקות תאימות, רגרסיה, קידום בטוח.
6. כלל יכולת תצפית (SRE + ML metrics), ניטור סחף והתראות.
7. לספק PII/אבטחה/רישיונות וביקורת.
8. הגדרת אוטוסקלה/QOS ומדיניות רב-תחומית.
9. הכן את ספר הריצות ושיהיה לך יום משחק.
10. הזן ניהול עלות: חבטות, קוונטיזציה, מטמון, RAG.

15) תרופות אנטי ־ פטריות

פרוס ”כפי שהוא” ללא קנרית/תצפית * תקריות בלתי צפויות.
לא עקבית/מקוון מאפיינים * אי התאמה מטרית.
היעדר בדיקות perf ומגבלות = p99 ”צפות”.
רישום תגובות/תגובות ללא אנונימיות * סיכון PII.
מאגר GPU נפוץ לכל דבר ללא QOS = קריטי באינטרנט סובל.
אין גלגיליות ותמונות של חפצים = = זמן השבתה ארוך.

תקציר

פריסה מוצלחת של דגמי ML הם חפצים בלימה, הגשה סטנדרטית, תהליך שחרור מאובטח (כנרית/כחול ירוק/צל), SLOs קשיח, ותצפית איכות/סחיפה/עלות. הוסף פיצ 'סטור, CI/CD עם שערי Perf, היגיינה PII, אוטוסקלה ו QOS - ושירותי האנטי הונאה/פרסונליזציה/LLM שלך ישמרו באופן עקבי על עומסי iGaming גבוהים בזמן שהם נשארים צפויים ב p99 ותקציב.

Contact

צרו קשר

פנו אלינו בכל שאלה או צורך בתמיכה.אנחנו תמיד כאן כדי לעזור.

Telegram
@Gamble_GC
התחלת אינטגרציה

Email הוא חובה. Telegram או WhatsApp — אופציונליים.

השם שלכם לא חובה
Email לא חובה
נושא לא חובה
הודעה לא חובה
Telegram לא חובה
@
אם תציינו Telegram — נענה גם שם, בנוסף ל-Email.
WhatsApp לא חובה
פורמט: קידומת מדינה ומספר (לדוגמה, +972XXXXXXXXX).

בלחיצה על הכפתור אתם מסכימים לעיבוד הנתונים שלכם.