एमएल मॉडल तैनात करना
(धारा: प्रौद्योगिकी और बुनियादी ढांचा)
संक्षिप्त सारांश
विश्वसनीय एमएल उत्पादन तैनाती का एक संग्रह है: घटनाओं पर दोहराव योग्य कलाकृतियां (मॉडल/टोकनाइज़र/कॉन्फिग), मानकीकृत सर्फिंग (ट्राइटन/केसर्वे/वीएलएम), सुरक्षित रिलीज प्रक्रिया (कैनरी/ब्लू ग/छाया)। कम विलंबता (एंटी-फ्रॉड/निजीकरण), सख्त एसएलओ, पीआईआई/अनुपालन और लागत नियंत्रण आईगेमिंग के लिए महत्वपूर्ण हैं।
1) तैनाती मोड
बैच (ऑफ़लाइन): रात/घंटे के कार्य (पूर्वव्यापी स्कोरिंग, अपडेटिंग सेगमेंट)। सस्ता, अनुमानित।
ऑनलाइन (तुल्यकालिक एपीआई): धोखाधड़ी विरोधी, निजीकरण, सिफारिशें, एलएलएम युक्तियाँ। p95 SLA की आवश्यकता होती है (उदाहरण के लिए, ≤ 100-300 ms)।
स्ट्रीम (निकट-वास्तविक समय): सीआरएम सिग्नल और ट्रिगर के लिए 1-60 सेकंड विंडो (फ्लिंक/स्पार्क/काफ्का स्ट्रीम)।
हाइब्रिड: ऑनलाइन फास्ट रफ स्कोर + ऑफ़ लाइन रिकॉल/कैलिब्रेशन।
2) कलाकृतियाँ और पैकेजिंग
मॉडल कलाकृतियाँ: वजन, टोकेनाइज़र, प्रीप्रोसेसिंग/पोस्टप्रोसेसिंग कॉन्फ़िग, डेटासेट/कोड संस्करण।
प्रारूप: PyTorch/TF मॉडल, संगतता के लिए ONNX, त्वरण के लिए TensorRT-इंजन, LLM परिमाणीकरण के लिए GGUF/awq/gptq।
कंटेनर: पिन की गई निर्भरता के साथ डॉकर ओसीआई छवियां; मल्टी-प्लेटफॉर्म टैग (CPU/GPU)।
अपरिवर्तनीय रिलीज़: टैगिंग 'मॉडल: धोखाधड़ी-v3। 2. 1 ',' छवि: धोखाधड़ी: 3। 2. 1`.
3) सेवारत मंच
ट्राइटन इन्वेंस सर्वर: मल्टी-मॉडल, डायनेमिक कसाई, पहनावा-पाइपलाइनें।
KServe (K8s-देशी): ऑटो-स्केल (HPA/KPA), कैनरी/छाया, अपना रनटाइम।
vLM/TGI (LLM): निरंतर बैचिंग, KV कैश, सट्टा डिकोडिंग।
Fichestor: फीचर समता के लिए ऑनलाइन (ms-SLA) + ऑफ़ लाइन।
KServe-canary उदाहरण (विचार):yaml apiVersion: serving. kserve. io/v1beta1 kind: InferenceService metadata: { name: fraud }
spec:
predictor:
canaryTrafficPercent: 15 model:
modelFormat: { name: triton }
storageUri: s3://models/fraud/v3. 2. 1/
resources: { limits: { nvidia. com/gpu: "1" } }
4) रिलीज की रणनीतियाँ
ब्लू-ग्रीन: दो समान ढेर, त्वरित ट्रैफिक स्विचिंग, सरल रोलबैक।
कैनरी: SLO/गुणवत्ता वाले फाटकों पर वृद्धिशील रूप से बढ़ ते यातायात (1% → 5% → 25% → 100%)।
छाया: नए मॉडल को यातायात की एक प्रति मिलती है, प्रतिक्रियाएं कुछ भी प्रभावित नहीं करती हैं - एक सुरक्षित अनुमान।
ए/बी परीक्षण: हम व्यावसायिक मैट्रिक्स (रूपांतरण, प्रतिधारण), सांख्यिकीय महत्व को मापते हैं।
रूटिंग नियमों का उदाहरण (छद्म-NGINX):
map $request_id $route {
default old;
"~ canary" new; # 5-15% by flag/cook/feature-toggle
}
5) एसएलओ और परिचालन बजट
ऑनलाइन धोखाधड़ी विरोधी/निजीकरण: p95 ≤ 100-150 ms, p99 ≤ 250-400 ms।
एलएलएम संकेत (128-512 टोकन): पहले टोकन, टोकन/एस ≥ लक्ष्य की p95 ≤ 300-800 एमएस पीढ़ी।
उपलब्धता: ≥ 99। महत्वपूर्ण रास्तों के लिए 9%।
गुणवत्ता: AUC/PR-AUC/Top-K @ N ≥ सीमा;% विषाक्त/गलत प्रतिक्रियाएं ≤ X.
लागत: $/1k अनुरोध या $/1k टोकन - बजट के भीतर।
6) मॉडल के लिए सीआई/सीडी
कन्वेयर:1. रजिस्ट्री में ट्रेन/फाइनेट्यून → मॉडल (मेटाडेटा: डेटा/कोड/मैट्रिक्स/लाइसेंस)।
2. पैक और मान्यता: इकाई परीक्षण पूर्व/पोस्ट, एपीआई संगतता, लोड परीक्षण (विलंबता/टोकन/एस)।
3. कैनरी तैनाती: 1-5% यातायात; अवलोकन (एसएलओ/गुणवत्ता/लागत)।
4. मानदंड फाटकों द्वारा/रोलबैक को बढ़ावा दें।
GitHub क्रियाओं के एक टुकड़े का एक उदाहरण (विचार):yaml jobs:
build-serve:
steps:
- run: make export_onnx && make docker_build
- run: pytest tests/serve --maxfail=1
- run: python perf_check. py --p95 120 --fail-on-regress
- run: kubectl apply -f kserve-canary. yaml
7) देरी और थ्रूपुट अनुकूलन
ट्राइटन/वीएलएम, अनुरोध संगोष्ठी, सीपीयू पर पूर्व-/पोस्ट-प्रोसेसिंग।
अंशांकन के साथ परिमाणीकरण (INT8/FP8/INT4); TensorRT/ONNX रनटाइम संकलन।
कैशिंग: एलएलएम के लिए फीचर (ऑनलाइन-फीचर/रेडिस), परिणाम और केवी कैश।
वार्मअप: डंपिंग के दौरान तराजू/कैश को गर्म करना; "गर्म" ऑटोस्केल चूल्हा।
समय बजट: प्रारंभिक स्टॉप, टोकन सीमा/बीम, तापमान अनुकूलन।
8) अवलोकन: टेलीमेट्री, बहाव, गुणवत्ता
SRE मेट्रिक्स: RPS, p50/p95/p99, त्रुटियां (5xx/4xx), GPU/CPU यूटिल, मेमोरी, कतार, बैच-फिल।
एमएल मैट्रिक्स: एयूसी/पीआर-एयूसी, अंशांकन त्रुटि, कवरेज, टोकन/एस, प्रतिक्रिया लंबाई, कैश हिट।
बहाव: इनपुट/सुविधाओं, वितरण शिफ्ट मॉनिटरिंग द्वारा पीएसआई/जेएस विचलन; अलर्ट।
ऑनलाइन गुणवत्ता: गोल्ड टेस्ट केस, उत्तर नमूना, स्वचालित आरएजी-स्कोर/एलएलएम विषाक्तता।
लॉगिंग: शीघ्र/अनुक्रिया (अनाम), trace_id, मॉडल संस्करण।
प्रोमेथियस उदाहरण (विचार):
inference_latency_ms_bucket{model="fraud-v3. 2. 1",le="100"} 12345 inference_qps{model="fraud-v3. 2. 1"} 450 tokens_per_second{model="llm-help-v1"} 210
9) फीचर प्रबंधन और स्थिरता
फ़ीचर-समता: समान ऑफ़ लाइन/ऑनलाइन परिवर्तन; कोड के रूप में संस्करण सुविधाएँ।
ऑनलाइन fichestor: ms-SLA, TTL, upsert, idempotency; सर्फिंग के करीब कैश।
बैकफिल/रिफ्रेश: ऑफलाइन मैट्रिक्स से ऑनलाइन स्कोरिंग रखने की योजना।
10) सुरक्षा, पीआईआई और लाइसेंस
PII: टोकन/मास्किंग, क्षेत्र द्वारा विभाजन (EU/TR/LATAM), आराम/पारगमन में एन्क्रिप्शन।
रहस्य/कुंजी: केएमएस/गोपनीयता प्रबंधक, छवियों में कोई रहस्य नहीं.
एलएलएम नीतियां: सामग्री फिल्टर, सुरक्षित स्टॉपर, लाल-टीमिंग।
लाइसेंस: डेटासेट/वजन के लिए स्थितियों की जांच करें, पुनर्वितरण/वाणिज्य पर प्रतिबंध।
अलगाव: GPU पूल के लिए namespace-RBAC, कोटा, दावेदार/सहिष्णुता।
11) ऑटोस्केल और QoS
ऑटोस्कलिंग: आरपीएस/कतार/विलंबता/जीपीयू-यूटिल द्वारा; हॉटलाइन के लिए मिनट-रेडी-पॉड्स।
QoS कक्षाएं: ऑनलाइन क्रिटिकल (एंटी-फ्रॉड)> LLM चैट> प्रयोग। महत्वपूर्ण के पक्ष में पूर्वगामी।
बहु-क्षेत्र: विलंबता-आधारित मार्ग, गर्म-वजन कैश, सुविधा प्रतिकृति।
12) रनबुक और घटनाएं
p99 ग्रोथ: चेक बैच-फिल, कतार, GPU-util, कैश मिस; आक्रामक कसाई/लोअर बीम/टोकन सक्षम करें।
गुणवत्ता गिर गई: पिछले संस्करण में रोलबैक, छाया चालू करें, बहाव के स्रोतों को ठीक करें।
लागत बढ़ रही है: परिमाणीकरण/TensorRT सक्षम करें, बैच बढ़ाएं, सुविधा/कैश का अनुकूलन करें, RAG/परिणाम कैश के माध्यम से LLM पीढ़ियों की आवृत्ति को कम करें।
पीआईआई घटना: तत्काल स्टॉप-द-लाइन, आर्टिफ़ैक्ट रिकॉल, एक्सेस ऑडिट, प्रक्रिया रिपोर्ट नियामक को।
13) नमूना टेम्पलेट
ट्राइटन - गतिशील बैचिंग (टुकड़ा):text dynamic_batching { preferred_batch_size: [4, 8, 16, 32]
max_queue_delay_microseconds: 2000 }
instance_group { kind: KIND_GPU count: 2 }
vLM लॉन्च (विचार):
--tensor-parallel-size 2
--max-num-seqs 512
--gpu-memory-utilization 0. 9
एपीआई संगतता जाँच (छद्म कोड):
python resp = client. score({"features": f}) # v3. 2. 1 assert set(resp. keys()) >= {"score","version","latency_ms"}
14) कार्यान्वयन चेकलिस्ट
1. एसएलओ/एसएलए (विलंबता/उपलब्धता/गुणवत्ता/लागत) को परिभाषित करें।
2. कलाकृतियों और मॉडल रजिस्ट्री (संस्करण, मेटाडेटा) को मानकीकृत करें।
3. एक सेवारत स्टैक (Triton/KServe/vLM) और एक fichester चुनें।
4. कैनरी/नीला हरा/छाया और स्वचालित द्वार स्थापित करें।
5. CI/CD का निर्माण: संगतता परीक्षण, पर्फ प्रतिगमन, सुरक्षित पदोन्नति।
6. अवलोकन (SRE + ML metrics), बहाव निगरानी और अलर्ट शामिल करें।
7. पीआईआई/सुरक्षा/लाइसेंस और लेखा परीक्षा प्रदान करें।
8. ऑटोस्केल/QoS और बहु-क्षेत्र नीतियों को कॉन्फ़िगर करें।
9. रनबुक तैयार करें और एक गेम-डे है।
10. लागत प्रबंधन दर्ज करें: कसाई, परिमाणीकरण, कैश, आरएजी।
15) एंटीपैटर्न
कैनरी/अवलोकन के बिना "जैसा कि" है - अप्रत्याशित घटनाएं।
असंगत ऑफ़ लाइन/ऑनलाइन सुविधाएँ - मीट्रिक विसंगति।
पर्फ परीक्षण और सीमा की अनुपस्थिति → p99 "फ्लोट्स"।
लॉगिंग संकेत/प्रतिक्रियाएँ बिना गुमनामी के → PII जोखिम।
QoS के बिना हर चीज के लिए एक सामान्य GPU पूल - महत्वपूर्ण ऑनलाइन ग्रस्त है।
कलाकृतियों का कोई रोलबैक और स्नैपशॉट नहीं है - लंबे समय तक।
सारांश
एमएल मॉडल की सफल तैनाती कंटेनरीकृत कलाकृतियां हैं, मानकीकृत सेवारत, एक सुरक्षित रिलीज प्रक्रिया (कैनरी/ब्लू-ग्रीन/शैडो), हार्ड एसएलओ, और गुणवत्ता/बहाव/लागत अवलोकन। Perf गेट्स, PII स्वच्छता, ऑटोस्केल और QoS के साथ fichestore, CI/CD जोड़ें - और आपकी एंटी-फ्रॉड/निजीकरण/LLM सेवाएं लगातार p99 और बजट में पूर्वानुमान्त्य रहते हुए हुए।