Logo GH

SystML մոդելներ

(Բաժին ՝ Տեխնոլոգիաներ և ենթակառուցվածքներ)

Live ռեզյումե

Հուսալի երկարաժամկետ ML-ն մի շարք է 'կրկնվող արտեֆակտներ (մոդել/tokenizer/shadow), ստանդարտացված serving (Triton/KServe/vLLM), անվտանգ ռելիզային գործընթաց (kanari/blu-grine/shadow), դիտարկումը (լատենտ, որակը, որակը, որակը, որակը, որակը, որակը, որակը, որակը, Դրեյֆ) և runbook-ը պատահականության համար։ IGaming-ի համար կրիտիկական են ցածր ուշացումը (հակաֆրոդ/կերպարացում), խիստ SLO, PII/complasens և արժեքի վերահսկումը։

1) Ռեժիմներ

Batch (ofline) 'գիշերային/ժամյա առաջադրանքներ (հետադարձ հայացքներ, հատվածների նորարարություն)։ Էժան, կանխատեսելի է։

Online (սինխրոն API) 'հակաֆրոդ, կերպարացում, առաջարկություններ, LLM առաջարկներ։ Պահանջում է p95 SLA (օրինակ, 100-300 մզ)։

Stream (near-real-time): Պատուհանները 1-60 վայրկյան (Flink/Spark/Kafka Streams) ազդանշանների և CRM հարվածների համար։

Հիբրիդ 'առցանց արագ կոպիտ սկորեր + օֆլինը վերահաշվարկում/տրամաչափում։

2) Արտեֆակտները և փաթեթավորումը

Մոդելային արտեֆակտներ 'քաշը, թունիզատորը, պրեսեկցիայի/հետերոսինգի դելեգները, դոդասետի/կոդի տարբերակը։

Express: PyTorch/TF SavedModel, ONNX մրցույթի համար, TronorRT-entine արագացնելու համար, GGUF/awq/gptq LLM քվանտիզացիայի համար։

Բեռնարկղեր ՝ Docker OCI պատկերներ pinned կախվածությամբ։ Ռուսական լատինական թեգերը (CPU/GPU)։

Immutable-Express: Teging 'model: fraud-v3։ 2. 1`, `image: fraud:3. 2. 1`.

3) Սերվինգի պլատֆորմը

Triton Inference Server: մուլտիմեդիա, դինամիկ բատչինգ, ensemble-pipelines։

KServe (K8s-national) 'Auto-skayl (HPA/KPA), kanari/shadou, սեփական runtime։

VLM/TGI (LLM): wwww.inuous batching, KV-kash, սպեկուլյատիվ։

Ֆիչեստորը 'on.ru (ms-SLA) + 230 մգ դելֆիչի համար (feature parity)։

KServe-kanari (գաղափարը)։

yaml apiVersion: serving. kserve. io/v1beta1 kind: InferenceService metadata: { name: fraud }
spec:
predictor:
canaryTrafficPercent: 15 model:
modelFormat: { name: triton }
storageUri: s3://models/fraud/v3. 2. 1/
resources: { limits: { nvidia. com/gpu: "1" } }

4) Օրինագծերի ռազմավարությունը

Blue-Green: Երկու նույնական ապակիներ, ակնթարթային շարժումը, պարզ արձագանքը։

Canary: մրցույթի աստիճանական բարձրացումը (1% 245 տոկոսը 2425 տոկոսը 24100%) SLO/որակի խաղերում։

Shadow 'նոր մոդելը ստանում է կոդավորման պատճենը, պատասխանները ոչ մի բանի վրա չեն ազդում' անվտանգ գնահատում։

A/B թեստերը 'չափում ենք բիզնես մետրերը (հակադարձում, պահպանում), վիճակագրական կարևորությունը։

Ռոտինգի կանոնների օրինակ (կեղծ-NGINX)


map $request_id $route {
default old;
"~ canary" new; # 5-15% by flag/cook/feature-toggle
}

5) SLO և աշխատանքային բյուջեներ

Առցանց հակաֆրոդը/կերպարը 'p95-100-150 մզ, p99-250-400 մզ։

LLM հուշումներ (105-512 հոսքեր): p95-300-800 ms առաջին հոսանքների, tokens/s novice։

Հասանելիություն ՝ 3699։ 9 տոկոսը կրիտիկական ճանապարհների համար։

Որակը ՝ AUC/PR-AUC/Top-K @ N-ն, թունավոր/սխալ պատասխանների% -ը X- ն է։

Արժեքը ՝ դոլար/1k հարցումներ կամ $/1k հոսանքներ - բյուջեի սահմաններում։

6) CI/CD մոդելների համար

Փոխակրիչ

1. Train/finetune-ը նկարագրում է մոդելը (մետատվյալներ ՝ տվյալներ/կոդ/մետրիկներ/լիցենզիա)։

2. Pack & Validate: unit թեստերը preprot ./հետպրոց, API-ի համատեղելիությունը, բեռի թեստերը (latency/tokens/s)։

3. Canary Deploy: 1-5 տոկոսը ռուսական; դիտարկումը (SLO/որակը/արժեքը)։

4. Promote/Rollback-ը չափանիշներով։

GitHub Actions (գաղափար)։

yaml jobs:
build-serve:
steps:
- run: make export_onnx && make docker_build
- run: pytest tests/serve --maxfail=1
- run: python perf_check. py --p95 120 --fail-on-regress
- run: kubectl apply -f kserve-canary. yaml

7) Հետաձգման և հետաձգման օպտիմիզացում

Batching/microbatching (Triton/vLM), հարցումների զուգահեռ, CPU-ի վրա։

Քվանտացիա (INT8/FP8/INT4) տրամաչափով։ TultorRT/ONNX Runtime-ի կազմումը։

Քեշինգը 'ֆիչ (onls-fichestor/Redis), արդյունքները և KV-քեշը LLM-ի համար։

Warmup: կշռերի/քեշի մեղմացում դոպլով; «տաք» լվացքի համար։

Թայմ բյուջեն 'վաղ կանգառը, հոսանքների/beam սահմանափակումը, ջերմաստիճանի հարմարեցումը։

8) Դիտողականությունը 'հեռաչափություն, դրեյֆ, որակ, որակ

MSE-մետրիկները ՝ RPS, p50/p95/p99, սխալները (5xx/4xx), GPU/CPU util, հիշողությունը, հերթը, batch-35l։

ML-մետրիկները ՝ AUC/PR-AUC, calibration error, coverage, tokens/s, պատասխանը երկարությունը, քաշ-հիթը։

Դրեյֆը ՝ PSI/JS-divergention մուտքերի/վերջույթների վրա, բաշխման փոփոխությունը։ ալերտներ։

Առցանց որակը 'վերահսկող ոսկու օրինակներ, պատասխանների սեմպլինգ, ավտոմատ RAG-score/թունավորություն LLM-ի համար։

Ամսագրում 'prompt/պատասխանը (անանուն), trace _ id, մոդելի տարբերակը։

Prometheus (գաղափարը)։


inference_latency_ms_bucket{model="fraud-v3. 2. 1",le="100"} 12345 inference_qps{model="fraud-v3. 2. 1"} 450 tokens_per_second{model="llm-help-v1"} 210

9) Վերջերի կառավարումը և ներդաշնակությունը

Feature-parity: Նույն փոխակերպումները www.ru/on.ru; տարբերակեք ֆիչին որպես կոդ։

Առցանց ֆիչեստորը 'ms-SLA, TTL, ups.ru, idempotency; Քեշը ավելի մոտ է սերվինգին։

Backfill/refresh: պլանը, որ առցանց կարբինգը չի տարբերվում օֆլայնային մետրիկների հետ։

10) Անվտանգություն, PII և լիցենզիա

PII 'տոկենիզացիա/դիմակավորում, հատվածներ տարածաշրջաններով (EU/TR/LATAM), կոդավորումը հանգիստ/տրանզիտում։

Գաղտնիքները/բանալիները ՝ KFC/Secrets Express, պատկերների գաղտնիքները։

LLM քաղաքականությունը 'բովանդակության ֆիլտրեր, անվտանգ հետքեր, red-teaming։

Լիցենզիաներ 'ստուգեք պայմանները/քաշը, արգելքները ռեդիստրիբյուտիայի/առևտրի վրա։

Մեկուսացում ՝ namespace-RBAC, քվոտաներ, tainae/toleration GPU փամփուշտների համար։

11) Ավտոսկեյլ և QoS

Autoscaling: RPS/հերթով/latency/GPU-util; min-ready-pods տաք գծերի համար։

QoS դասարաններ 'քննադատական առցանց (anti-fraud)> LLM-chat> փորձարկումներ։ Systemption-ը հօգուտ քննադատների։

Multiregion: latency-based routing, ծանրաբեռնված կաշվե, fich կրկնօրինակումը։

12) Runbooks և միջադեպեր

P99 աճը 'ստուգել batch-24l, հերթը, GPU-util, kash-miss; միացրեք ագրեսիվ մարտկոցը/իջեցնել beam/towens։

Որակը նվազեց 'արձագանքը նախորդ տարբերակին, միացրեք shadow, ամրագրել դրեյֆի աղբյուրները։

Արժեքը մեծանում է 'ներառել քվանտիզացիա/TronorRT, բարձրացնել մարտը, օպտիմիզացնել ֆիչին/քեշը, նվազեցնել LLM գեներացիաների հաճախությունը RAG/արդյունքը-քեշի միջոցով։

PII-պատահարը 'վերացված stop-the-2019, արտեֆակտների արձագանքը, հասանելիության աուդիտը, կարգավորիչի զեկույցը ընթացակարգով։

13) Ձևանմուշների օրինակներ

Triton-ը contic batching (հատված)։

text dynamic_batching { preferred_batch_size: [4, 8, 16, 32]
max_queue_delay_microseconds: 2000 }
instance_group { kind: KIND_GPU count: 2 }

VLM (գաղափարներ)


--tensor-parallel-size 2
--max-num-seqs 512
--gpu-memory-utilization 0. 9

API կոդավորման ստուգումը (կեղծ)

python resp = client. score({"features": f}) # v3. 2. 1 assert set(resp. keys()) >= {"score","version","latency_ms"}

14) Ներդրման չեկի ցուցակ

1. SLO/SLA (latency/availability/quality/cost)։

2. Ստանդարտացրեք արտեֆակտները և մոդելները (տարբերակներ, մետատվյալներ)։

3. Ընտրեք սերվինգը (Triton/KServe/vLM) և ֆիչեստորը։

4. Պարարտանյութեր/բլյու-գրին/shadow և ավտոմատ խաղեր։

5. Կառուցում եք CI/CD 'թեստեր, ռեգրեսիա, անվտանգ առաջընթաց։

6. Միացրեք դիտարկումը (MSE + ML-ML-metrics), dreef-Media-ը և ալերտները։

7. Ապահովեք PII/անվտանգություն/լիցենզիա և աուդիտ։

8. Պարարտանյութը/QoS-ն և բազմաբնույթ քաղաքականությունները։

9. Պատրաստեք runbook-եւ և կատարեք game-day։

10. Մուտքագրեք արժեքի կառավարումը 'բատչինգը, քվանտիզացիան, քեշը, RAG։

15) Անտիպատերնի

«Ինչպե՞ ս կա», առանց կանարի/դիտարկման, անսպասելի միջադեպեր են տեղի ունենում։

Չհամաձայնեցված fichions www.ru/on.ru-ը բացատրում է մետրիկի տարբերությունը։

Պերֆի թեստերի և լիմիտների բացակայությունը p99 «լողում» է։

Պրոմպտի/պատասխանների տրամաբանությունը առանց անանունացման բացատրում է PII ռիսկը։

Մեկ ընդհանուր GPU-փամփուշտը միայն առանց QoS-ի համար կրիտիկական առցանց տառապում է։

Արտեֆակտների և կեղտաջրերի ոչ մի արձագանք չկա։

Արդյունքները

ML մոդելների հաջողակ իրականացումը բեռնված արտեֆակտներն են, ստանդարտացված սերվինգը, անվտանգ էքսպոզիցիոն գործընթացը (canary/blue-green/shadow), կոշտ SLO-ը և որակի/dreaff/արժեքի դիտարկումը։ Ավելացրեք ֆիչեստորը, CI/CD-ն 'պերֆի գեյտերի, PII-հիգիենայի, ավտոսկրի և QoS-ի հետ, և ձեր հակաֆրոդը/կերպարը/LLM ծառայությունները կայուն կպահպանեն iGaming-ի գագաթնակետը' մնալով կանխատեսելի p99 և 105։

Contact

Կապ հաստատեք մեզ հետ

Կապ հաստատեք մեզ հետ ցանկացած հարցի կամ աջակցության համար։Մենք միշտ պատրաստ ենք օգնել։

Telegram
@Gamble_GC
Սկսել ինտեգրացիան

Email-ը՝ պարտադիր է։ Telegram կամ WhatsApp — ըստ ցանկության։

Ձեր անունը ըստ ցանկության
Email ըստ ցանկության
Թեմա ըստ ցանկության
Նամակի բովանդակություն ըստ ցանկության
Telegram ըստ ցանկության
@
Եթե նշեք Telegram — մենք կպատասխանենք նաև այնտեղ՝ Email-ի дополнение-ով։
WhatsApp ըստ ցանկության
Ձևաչափ՝ երկրի կոդ և համար (օրինակ՝ +374XXXXXXXXX)։

Սեղմելով կոճակը՝ դուք համաձայնում եք տվյալների մշակման հետ։