SystML մոդելներ
(Բաժին ՝ Տեխնոլոգիաներ և ենթակառուցվածքներ)
Live ռեզյումե
Հուսալի երկարաժամկետ ML-ն մի շարք է 'կրկնվող արտեֆակտներ (մոդել/tokenizer/shadow), ստանդարտացված serving (Triton/KServe/vLLM), անվտանգ ռելիզային գործընթաց (kanari/blu-grine/shadow), դիտարկումը (լատենտ, որակը, որակը, որակը, որակը, որակը, որակը, որակը, որակը, Դրեյֆ) և runbook-ը պատահականության համար։ IGaming-ի համար կրիտիկական են ցածր ուշացումը (հակաֆրոդ/կերպարացում), խիստ SLO, PII/complasens և արժեքի վերահսկումը։
1) Ռեժիմներ
Batch (ofline) 'գիշերային/ժամյա առաջադրանքներ (հետադարձ հայացքներ, հատվածների նորարարություն)։ Էժան, կանխատեսելի է։
Online (սինխրոն API) 'հակաֆրոդ, կերպարացում, առաջարկություններ, LLM առաջարկներ։ Պահանջում է p95 SLA (օրինակ, 100-300 մզ)։
Stream (near-real-time): Պատուհանները 1-60 վայրկյան (Flink/Spark/Kafka Streams) ազդանշանների և CRM հարվածների համար։
Հիբրիդ 'առցանց արագ կոպիտ սկորեր + օֆլինը վերահաշվարկում/տրամաչափում։
2) Արտեֆակտները և փաթեթավորումը
Մոդելային արտեֆակտներ 'քաշը, թունիզատորը, պրեսեկցիայի/հետերոսինգի դելեգները, դոդասետի/կոդի տարբերակը։
Express: PyTorch/TF SavedModel, ONNX մրցույթի համար, TronorRT-entine արագացնելու համար, GGUF/awq/gptq LLM քվանտիզացիայի համար։
Բեռնարկղեր ՝ Docker OCI պատկերներ pinned կախվածությամբ։ Ռուսական լատինական թեգերը (CPU/GPU)։
Immutable-Express: Teging 'model: fraud-v3։ 2. 1`, `image: fraud:3. 2. 1`.
3) Սերվինգի պլատֆորմը
Triton Inference Server: մուլտիմեդիա, դինամիկ բատչինգ, ensemble-pipelines։
KServe (K8s-national) 'Auto-skayl (HPA/KPA), kanari/shadou, սեփական runtime։
VLM/TGI (LLM): wwww.inuous batching, KV-kash, սպեկուլյատիվ։
Ֆիչեստորը 'on.ru (ms-SLA) + 230 մգ դելֆիչի համար (feature parity)։
KServe-kanari (գաղափարը)։
yaml apiVersion: serving. kserve. io/v1beta1 kind: InferenceService metadata: { name: fraud }
spec:
predictor:
canaryTrafficPercent: 15 model:
modelFormat: { name: triton }
storageUri: s3://models/fraud/v3. 2. 1/
resources: { limits: { nvidia. com/gpu: "1" } }
4) Օրինագծերի ռազմավարությունը
Blue-Green: Երկու նույնական ապակիներ, ակնթարթային շարժումը, պարզ արձագանքը։
Canary: մրցույթի աստիճանական բարձրացումը (1% 245 տոկոսը 2425 տոկոսը 24100%) SLO/որակի խաղերում։
Shadow 'նոր մոդելը ստանում է կոդավորման պատճենը, պատասխանները ոչ մի բանի վրա չեն ազդում' անվտանգ գնահատում։
A/B թեստերը 'չափում ենք բիզնես մետրերը (հակադարձում, պահպանում), վիճակագրական կարևորությունը։
Ռոտինգի կանոնների օրինակ (կեղծ-NGINX)
map $request_id $route {
default old;
"~ canary" new; # 5-15% by flag/cook/feature-toggle
}
5) SLO և աշխատանքային բյուջեներ
Առցանց հակաֆրոդը/կերպարը 'p95-100-150 մզ, p99-250-400 մզ։
LLM հուշումներ (105-512 հոսքեր): p95-300-800 ms առաջին հոսանքների, tokens/s novice։
Հասանելիություն ՝ 3699։ 9 տոկոսը կրիտիկական ճանապարհների համար։
Որակը ՝ AUC/PR-AUC/Top-K @ N-ն, թունավոր/սխալ պատասխանների% -ը X- ն է։
Արժեքը ՝ դոլար/1k հարցումներ կամ $/1k հոսանքներ - բյուջեի սահմաններում։
6) CI/CD մոդելների համար
Փոխակրիչ
1. Train/finetune-ը նկարագրում է մոդելը (մետատվյալներ ՝ տվյալներ/կոդ/մետրիկներ/լիցենզիա)։
2. Pack & Validate: unit թեստերը preprot ./հետպրոց, API-ի համատեղելիությունը, բեռի թեստերը (latency/tokens/s)։
3. Canary Deploy: 1-5 տոկոսը ռուսական; դիտարկումը (SLO/որակը/արժեքը)։
4. Promote/Rollback-ը չափանիշներով։
GitHub Actions (գաղափար)։
yaml jobs:
build-serve:
steps:
- run: make export_onnx && make docker_build
- run: pytest tests/serve --maxfail=1
- run: python perf_check. py --p95 120 --fail-on-regress
- run: kubectl apply -f kserve-canary. yaml
7) Հետաձգման և հետաձգման օպտիմիզացում
Batching/microbatching (Triton/vLM), հարցումների զուգահեռ, CPU-ի վրա։
Քվանտացիա (INT8/FP8/INT4) տրամաչափով։ TultorRT/ONNX Runtime-ի կազմումը։
Քեշինգը 'ֆիչ (onls-fichestor/Redis), արդյունքները և KV-քեշը LLM-ի համար։
Warmup: կշռերի/քեշի մեղմացում դոպլով; «տաք» լվացքի համար։
Թայմ բյուջեն 'վաղ կանգառը, հոսանքների/beam սահմանափակումը, ջերմաստիճանի հարմարեցումը։
8) Դիտողականությունը 'հեռաչափություն, դրեյֆ, որակ, որակ
MSE-մետրիկները ՝ RPS, p50/p95/p99, սխալները (5xx/4xx), GPU/CPU util, հիշողությունը, հերթը, batch-35l։
ML-մետրիկները ՝ AUC/PR-AUC, calibration error, coverage, tokens/s, պատասխանը երկարությունը, քաշ-հիթը։
Դրեյֆը ՝ PSI/JS-divergention մուտքերի/վերջույթների վրա, բաշխման փոփոխությունը։ ալերտներ։
Առցանց որակը 'վերահսկող ոսկու օրինակներ, պատասխանների սեմպլինգ, ավտոմատ RAG-score/թունավորություն LLM-ի համար։
Ամսագրում 'prompt/պատասխանը (անանուն), trace _ id, մոդելի տարբերակը։
Prometheus (գաղափարը)։
inference_latency_ms_bucket{model="fraud-v3. 2. 1",le="100"} 12345 inference_qps{model="fraud-v3. 2. 1"} 450 tokens_per_second{model="llm-help-v1"} 210
9) Վերջերի կառավարումը և ներդաշնակությունը
Feature-parity: Նույն փոխակերպումները www.ru/on.ru; տարբերակեք ֆիչին որպես կոդ։
Առցանց ֆիչեստորը 'ms-SLA, TTL, ups.ru, idempotency; Քեշը ավելի մոտ է սերվինգին։
Backfill/refresh: պլանը, որ առցանց կարբինգը չի տարբերվում օֆլայնային մետրիկների հետ։
10) Անվտանգություն, PII և լիցենզիա
PII 'տոկենիզացիա/դիմակավորում, հատվածներ տարածաշրջաններով (EU/TR/LATAM), կոդավորումը հանգիստ/տրանզիտում։
Գաղտնիքները/բանալիները ՝ KFC/Secrets Express, պատկերների գաղտնիքները։
LLM քաղաքականությունը 'բովանդակության ֆիլտրեր, անվտանգ հետքեր, red-teaming։
Լիցենզիաներ 'ստուգեք պայմանները/քաշը, արգելքները ռեդիստրիբյուտիայի/առևտրի վրա։
Մեկուսացում ՝ namespace-RBAC, քվոտաներ, tainae/toleration GPU փամփուշտների համար։
11) Ավտոսկեյլ և QoS
Autoscaling: RPS/հերթով/latency/GPU-util; min-ready-pods տաք գծերի համար։
QoS դասարաններ 'քննադատական առցանց (anti-fraud)> LLM-chat> փորձարկումներ։ Systemption-ը հօգուտ քննադատների։
Multiregion: latency-based routing, ծանրաբեռնված կաշվե, fich կրկնօրինակումը։
12) Runbooks և միջադեպեր
P99 աճը 'ստուգել batch-24l, հերթը, GPU-util, kash-miss; միացրեք ագրեսիվ մարտկոցը/իջեցնել beam/towens։
Որակը նվազեց 'արձագանքը նախորդ տարբերակին, միացրեք shadow, ամրագրել դրեյֆի աղբյուրները։
Արժեքը մեծանում է 'ներառել քվանտիզացիա/TronorRT, բարձրացնել մարտը, օպտիմիզացնել ֆիչին/քեշը, նվազեցնել LLM գեներացիաների հաճախությունը RAG/արդյունքը-քեշի միջոցով։
PII-պատահարը 'վերացված stop-the-2019, արտեֆակտների արձագանքը, հասանելիության աուդիտը, կարգավորիչի զեկույցը ընթացակարգով։
13) Ձևանմուշների օրինակներ
Triton-ը contic batching (հատված)։
text dynamic_batching { preferred_batch_size: [4, 8, 16, 32]
max_queue_delay_microseconds: 2000 }
instance_group { kind: KIND_GPU count: 2 }
VLM (գաղափարներ)
--tensor-parallel-size 2
--max-num-seqs 512
--gpu-memory-utilization 0. 9
API կոդավորման ստուգումը (կեղծ)
python resp = client. score({"features": f}) # v3. 2. 1 assert set(resp. keys()) >= {"score","version","latency_ms"}
14) Ներդրման չեկի ցուցակ
1. SLO/SLA (latency/availability/quality/cost)։
2. Ստանդարտացրեք արտեֆակտները և մոդելները (տարբերակներ, մետատվյալներ)։
3. Ընտրեք սերվինգը (Triton/KServe/vLM) և ֆիչեստորը։
4. Պարարտանյութեր/բլյու-գրին/shadow և ավտոմատ խաղեր։
5. Կառուցում եք CI/CD 'թեստեր, ռեգրեսիա, անվտանգ առաջընթաց։
6. Միացրեք դիտարկումը (MSE + ML-ML-metrics), dreef-Media-ը և ալերտները։
7. Ապահովեք PII/անվտանգություն/լիցենզիա և աուդիտ։
8. Պարարտանյութը/QoS-ն և բազմաբնույթ քաղաքականությունները։
9. Պատրաստեք runbook-եւ և կատարեք game-day։
10. Մուտքագրեք արժեքի կառավարումը 'բատչինգը, քվանտիզացիան, քեշը, RAG։
15) Անտիպատերնի
«Ինչպե՞ ս կա», առանց կանարի/դիտարկման, անսպասելի միջադեպեր են տեղի ունենում։
Չհամաձայնեցված fichions www.ru/on.ru-ը բացատրում է մետրիկի տարբերությունը։
Պերֆի թեստերի և լիմիտների բացակայությունը p99 «լողում» է։
Պրոմպտի/պատասխանների տրամաբանությունը առանց անանունացման բացատրում է PII ռիսկը։
Մեկ ընդհանուր GPU-փամփուշտը միայն առանց QoS-ի համար կրիտիկական առցանց տառապում է։
Արտեֆակտների և կեղտաջրերի ոչ մի արձագանք չկա։
Արդյունքները
ML մոդելների հաջողակ իրականացումը բեռնված արտեֆակտներն են, ստանդարտացված սերվինգը, անվտանգ էքսպոզիցիոն գործընթացը (canary/blue-green/shadow), կոշտ SLO-ը և որակի/dreaff/արժեքի դիտարկումը։ Ավելացրեք ֆիչեստորը, CI/CD-ն 'պերֆի գեյտերի, PII-հիգիենայի, ավտոսկրի և QoS-ի հետ, և ձեր հակաֆրոդը/կերպարը/LLM ծառայությունները կայուն կպահպանեն iGaming-ի գագաթնակետը' մնալով կանխատեսելի p99 և 105։