Logo GH

एमएल मॉडल तैनात करना

(धारा: प्रौद्योगिकी और बुनियादी ढांचा)

संक्षिप्त सारांश

विश्वसनीय एमएल उत्पादन तैनाती का एक संग्रह है: घटनाओं पर दोहराव योग्य कलाकृतियां (मॉडल/टोकनाइज़र/कॉन्फिग), मानकीकृत सर्फिंग (ट्राइटन/केसर्वे/वीएलएम), सुरक्षित रिलीज प्रक्रिया (कैनरी/ब्लू ग/छाया)। कम विलंबता (एंटी-फ्रॉड/निजीकरण), सख्त एसएलओ, पीआईआई/अनुपालन और लागत नियंत्रण आईगेमिंग के लिए महत्वपूर्ण हैं।

1) तैनाती मोड

बैच (ऑफ़लाइन): रात/घंटे के कार्य (पूर्वव्यापी स्कोरिंग, अपडेटिंग सेगमेंट)। सस्ता, अनुमानित।

ऑनलाइन (तुल्यकालिक एपीआई): धोखाधड़ी विरोधी, निजीकरण, सिफारिशें, एलएलएम युक्तियाँ। p95 SLA की आवश्यकता होती है (उदाहरण के लिए, ≤ 100-300 ms)।

स्ट्रीम (निकट-वास्तविक समय): सीआरएम सिग्नल और ट्रिगर के लिए 1-60 सेकंड विंडो (फ्लिंक/स्पार्क/काफ्का स्ट्रीम)।

हाइब्रिड: ऑनलाइन फास्ट रफ स्कोर + ऑफ़ लाइन रिकॉल/कैलिब्रेशन।

2) कलाकृतियाँ और पैकेजिंग

मॉडल कलाकृतियाँ: वजन, टोकेनाइज़र, प्रीप्रोसेसिंग/पोस्टप्रोसेसिंग कॉन्फ़िग, डेटासेट/कोड संस्करण।

प्रारूप: PyTorch/TF मॉडल, संगतता के लिए ONNX, त्वरण के लिए TensorRT-इंजन, LLM परिमाणीकरण के लिए GGUF/awq/gptq।

कंटेनर: पिन की गई निर्भरता के साथ डॉकर ओसीआई छवियां; मल्टी-प्लेटफॉर्म टैग (CPU/GPU)।

अपरिवर्तनीय रिलीज़: टैगिंग 'मॉडल: धोखाधड़ी-v3। 2. 1 ',' छवि: धोखाधड़ी: 3। 2. 1`.

3) सेवारत मंच

ट्राइटन इन्वेंस सर्वर: मल्टी-मॉडल, डायनेमिक कसाई, पहनावा-पाइपलाइनें।

KServe (K8s-देशी): ऑटो-स्केल (HPA/KPA), कैनरी/छाया, अपना रनटाइम।

vLM/TGI (LLM): निरंतर बैचिंग, KV कैश, सट्टा डिकोडिंग।

Fichestor: फीचर समता के लिए ऑनलाइन (ms-SLA) + ऑफ़ लाइन।

KServe-canary उदाहरण (विचार):
yaml apiVersion: serving. kserve. io/v1beta1 kind: InferenceService metadata: { name: fraud }
spec:
predictor:
canaryTrafficPercent: 15 model:
modelFormat: { name: triton }
storageUri: s3://models/fraud/v3. 2. 1/
resources: { limits: { nvidia. com/gpu: "1" } }

4) रिलीज की रणनीतियाँ

ब्लू-ग्रीन: दो समान ढेर, त्वरित ट्रैफिक स्विचिंग, सरल रोलबैक।

कैनरी: SLO/गुणवत्ता वाले फाटकों पर वृद्धिशील रूप से बढ़ ते यातायात (1% → 5% → 25% → 100%)।

छाया: नए मॉडल को यातायात की एक प्रति मिलती है, प्रतिक्रियाएं कुछ भी प्रभावित नहीं करती हैं - एक सुरक्षित अनुमान।

ए/बी परीक्षण: हम व्यावसायिक मैट्रिक्स (रूपांतरण, प्रतिधारण), सांख्यिकीय महत्व को मापते हैं।

रूटिंग नियमों का उदाहरण (छद्म-NGINX):

map $request_id $route {
default old;
"~ canary" new; # 5-15% by flag/cook/feature-toggle
}

5) एसएलओ और परिचालन बजट

ऑनलाइन धोखाधड़ी विरोधी/निजीकरण: p95 ≤ 100-150 ms, p99 ≤ 250-400 ms।

एलएलएम संकेत (128-512 टोकन): पहले टोकन, टोकन/एस ≥ लक्ष्य की p95 ≤ 300-800 एमएस पीढ़ी।

उपलब्धता: ≥ 99। महत्वपूर्ण रास्तों के लिए 9%।

गुणवत्ता: AUC/PR-AUC/Top-K @ N ≥ सीमा;% विषाक्त/गलत प्रतिक्रियाएं ≤ X.

लागत: $/1k अनुरोध या $/1k टोकन - बजट के भीतर।

6) मॉडल के लिए सीआई/सीडी

कन्वेयर:

1. रजिस्ट्री में ट्रेन/फाइनेट्यून → मॉडल (मेटाडेटा: डेटा/कोड/मैट्रिक्स/लाइसेंस)।

2. पैक और मान्यता: इकाई परीक्षण पूर्व/पोस्ट, एपीआई संगतता, लोड परीक्षण (विलंबता/टोकन/एस)।

3. कैनरी तैनाती: 1-5% यातायात; अवलोकन (एसएलओ/गुणवत्ता/लागत)।

4. मानदंड फाटकों द्वारा/रोलबैक को बढ़ावा दें।

GitHub क्रियाओं के एक टुकड़े का एक उदाहरण (विचार):
yaml jobs:
build-serve:
steps:
- run: make export_onnx && make docker_build
- run: pytest tests/serve --maxfail=1
- run: python perf_check. py --p95 120 --fail-on-regress
- run: kubectl apply -f kserve-canary. yaml

7) देरी और थ्रूपुट अनुकूलन

ट्राइटन/वीएलएम, अनुरोध संगोष्ठी, सीपीयू पर पूर्व-/पोस्ट-प्रोसेसिंग।

अंशांकन के साथ परिमाणीकरण (INT8/FP8/INT4); TensorRT/ONNX रनटाइम संकलन।

कैशिंग: एलएलएम के लिए फीचर (ऑनलाइन-फीचर/रेडिस), परिणाम और केवी कैश।

वार्मअप: डंपिंग के दौरान तराजू/कैश को गर्म करना; "गर्म" ऑटोस्केल चूल्हा।

समय बजट: प्रारंभिक स्टॉप, टोकन सीमा/बीम, तापमान अनुकूलन।

8) अवलोकन: टेलीमेट्री, बहाव, गुणवत्ता

SRE मेट्रिक्स: RPS, p50/p95/p99, त्रुटियां (5xx/4xx), GPU/CPU यूटिल, मेमोरी, कतार, बैच-फिल।

एमएल मैट्रिक्स: एयूसी/पीआर-एयूसी, अंशांकन त्रुटि, कवरेज, टोकन/एस, प्रतिक्रिया लंबाई, कैश हिट।

बहाव: इनपुट/सुविधाओं, वितरण शिफ्ट मॉनिटरिंग द्वारा पीएसआई/जेएस विचलन; अलर्ट।

ऑनलाइन गुणवत्ता: गोल्ड टेस्ट केस, उत्तर नमूना, स्वचालित आरएजी-स्कोर/एलएलएम विषाक्तता।

लॉगिंग: शीघ्र/अनुक्रिया (अनाम), trace_id, मॉडल संस्करण।

प्रोमेथियस उदाहरण (विचार):

inference_latency_ms_bucket{model="fraud-v3. 2. 1",le="100"} 12345 inference_qps{model="fraud-v3. 2. 1"} 450 tokens_per_second{model="llm-help-v1"} 210

9) फीचर प्रबंधन और स्थिरता

फ़ीचर-समता: समान ऑफ़ लाइन/ऑनलाइन परिवर्तन; कोड के रूप में संस्करण सुविधाएँ।

ऑनलाइन fichestor: ms-SLA, TTL, upsert, idempotency; सर्फिंग के करीब कैश।

बैकफिल/रिफ्रेश: ऑफलाइन मैट्रिक्स से ऑनलाइन स्कोरिंग रखने की योजना।

10) सुरक्षा, पीआईआई और लाइसेंस

PII: टोकन/मास्किंग, क्षेत्र द्वारा विभाजन (EU/TR/LATAM), आराम/पारगमन में एन्क्रिप्शन।

रहस्य/कुंजी: केएमएस/गोपनीयता प्रबंधक, छवियों में कोई रहस्य नहीं.

एलएलएम नीतियां: सामग्री फिल्टर, सुरक्षित स्टॉपर, लाल-टीमिंग।

लाइसेंस: डेटासेट/वजन के लिए स्थितियों की जांच करें, पुनर्वितरण/वाणिज्य पर प्रतिबंध।

अलगाव: GPU पूल के लिए namespace-RBAC, कोटा, दावेदार/सहिष्णुता।

11) ऑटोस्केल और QoS

ऑटोस्कलिंग: आरपीएस/कतार/विलंबता/जीपीयू-यूटिल द्वारा; हॉटलाइन के लिए मिनट-रेडी-पॉड्स।

QoS कक्षाएं: ऑनलाइन क्रिटिकल (एंटी-फ्रॉड)> LLM चैट> प्रयोग। महत्वपूर्ण के पक्ष में पूर्वगामी।

बहु-क्षेत्र: विलंबता-आधारित मार्ग, गर्म-वजन कैश, सुविधा प्रतिकृति।

12) रनबुक और घटनाएं

p99 ग्रोथ: चेक बैच-फिल, कतार, GPU-util, कैश मिस; आक्रामक कसाई/लोअर बीम/टोकन सक्षम करें।

गुणवत्ता गिर गई: पिछले संस्करण में रोलबैक, छाया चालू करें, बहाव के स्रोतों को ठीक करें।

लागत बढ़ रही है: परिमाणीकरण/TensorRT सक्षम करें, बैच बढ़ाएं, सुविधा/कैश का अनुकूलन करें, RAG/परिणाम कैश के माध्यम से LLM पीढ़ियों की आवृत्ति को कम करें।

पीआईआई घटना: तत्काल स्टॉप-द-लाइन, आर्टिफ़ैक्ट रिकॉल, एक्सेस ऑडिट, प्रक्रिया रिपोर्ट नियामक को।

13) नमूना टेम्पलेट

ट्राइटन - गतिशील बैचिंग (टुकड़ा):
text dynamic_batching { preferred_batch_size: [4, 8, 16, 32]
max_queue_delay_microseconds: 2000 }
instance_group { kind: KIND_GPU count: 2 }
vLM लॉन्च (विचार):

--tensor-parallel-size 2
--max-num-seqs 512
--gpu-memory-utilization 0. 9
एपीआई संगतता जाँच (छद्म कोड):
python resp = client. score({"features": f}) # v3. 2. 1 assert set(resp. keys()) >= {"score","version","latency_ms"}

14) कार्यान्वयन चेकलिस्ट

1. एसएलओ/एसएलए (विलंबता/उपलब्धता/गुणवत्ता/लागत) को परिभाषित करें।

2. कलाकृतियों और मॉडल रजिस्ट्री (संस्करण, मेटाडेटा) को मानकीकृत करें।

3. एक सेवारत स्टैक (Triton/KServe/vLM) और एक fichester चुनें।

4. कैनरी/नीला हरा/छाया और स्वचालित द्वार स्थापित करें।

5. CI/CD का निर्माण: संगतता परीक्षण, पर्फ प्रतिगमन, सुरक्षित पदोन्नति।

6. अवलोकन (SRE + ML metrics), बहाव निगरानी और अलर्ट शामिल करें।

7. पीआईआई/सुरक्षा/लाइसेंस और लेखा परीक्षा प्रदान करें।

8. ऑटोस्केल/QoS और बहु-क्षेत्र नीतियों को कॉन्फ़िगर करें।

9. रनबुक तैयार करें और एक गेम-डे है।

10. लागत प्रबंधन दर्ज करें: कसाई, परिमाणीकरण, कैश, आरएजी।

15) एंटीपैटर्न

कैनरी/अवलोकन के बिना "जैसा कि" है - अप्रत्याशित घटनाएं।

असंगत ऑफ़ लाइन/ऑनलाइन सुविधाएँ - मीट्रिक विसंगति।

पर्फ परीक्षण और सीमा की अनुपस्थिति → p99 "फ्लोट्स"।

लॉगिंग संकेत/प्रतिक्रियाएँ बिना गुमनामी के → PII जोखिम।

QoS के बिना हर चीज के लिए एक सामान्य GPU पूल - महत्वपूर्ण ऑनलाइन ग्रस्त है।

कलाकृतियों का कोई रोलबैक और स्नैपशॉट नहीं है - लंबे समय तक।

सारांश

एमएल मॉडल की सफल तैनाती कंटेनरीकृत कलाकृतियां हैं, मानकीकृत सेवारत, एक सुरक्षित रिलीज प्रक्रिया (कैनरी/ब्लू-ग्रीन/शैडो), हार्ड एसएलओ, और गुणवत्ता/बहाव/लागत अवलोकन। Perf गेट्स, PII स्वच्छता, ऑटोस्केल और QoS के साथ fichestore, CI/CD जोड़ें - और आपकी एंटी-फ्रॉड/निजीकरण/LLM सेवाएं लगातार p99 और बजट में पूर्वानुमान्त्य रहते हुए हुए।

Contact

हमसे संपर्क करें

किसी भी प्रश्न या सहायता के लिए हमसे संपर्क करें।हम हमेशा मदद के लिए तैयार हैं!

Telegram
@Gamble_GC
इंटीग्रेशन शुरू करें

Email — अनिवार्य है। Telegram या WhatsApp — वैकल्पिक हैं।

आपका नाम वैकल्पिक
Email वैकल्पिक
विषय वैकल्पिक
संदेश वैकल्पिक
Telegram वैकल्पिक
@
अगर आप Telegram डालते हैं — तो हम Email के साथ-साथ वहीं भी जवाब देंगे।
WhatsApp वैकल्पिक
फॉर्मैट: देश कोड और नंबर (उदा. +91XXXXXXXXXX)।

बटन दबाकर आप अपने डेटा की प्रोसेसिंग के लिए सहमति देते हैं।