Logo GH

ML моделдерин жайгаштыруу

(Бөлүк: Технология жана инфраструктура)

Кыскача резюме

Ишенимдүү ML Production жайылтуу жыйындысы болуп саналат: кайталануучу артефакттар (модель/токенайзер/ ), стандартташтырылган серввинг (Triton/KServe/vLLM), коопсуз релиз процесси (канарлар/блю-грин/shadow), байкоо жүргүзүү (латенттүүлүк, сапаты, дрейф) жана окуялар боюнча runbook. iGaming үчүн критикалык төмөн кечигүү (анти-жол/персоналдаштыруу), катуу SLO, PII/комплаенс жана нарк контролдоо.

1) жайгаштыруу режимдери

Batch (оффлайн): түнкү/сааттык тапшырмалар (рецензия, сегменттерди жаңыртуу). Арзан, алдын ала.
Online (синхрондуу API): антифрод, персоналдаштыруу, сунуштар, LLM кеңештери. p95 SLA талап кылат (мисалы, ≤ 100-300 ms).
Агым (near-реалдуу убакыт): 1-60 секунд терезелер (Flink/Spark/Kafka Streams) CRM сигналдар жана триггерлер үчүн.
Гибрид: онлайн тез орой скорер + оффлайн кайра эсептөө/калибрлөө.

2) Артефакттар жана таңгактоо

Моделдик артефакттар: салмак, токенизатор, препроцессинг/постпроцессинг конфиги, дата/код версиясы.
Форматтар: PyTorch/TF SavedModel, ONNX шайкештиги үчүн, TensorRT-engine тездетүү үчүн, GGUF/awq/gptq LLM квантировкасы үчүн.
Контейнерлер: Docker OCI-сүрөттөр менен pinned көз карандылык; көп платформалуу тактар (CPU/GPU).
Immutable-релиздер: тегиздөө 'модели: fraud-v3. 2. 1`, `image: fraud:3. 2. 1`.

3) Сервинг платформасы

Triton Inference Server: multimodel, динамикалык батчинг, ensemble-pipelines.
KServe (K8s-жергиликтүү): авто скейл (HPA/KPA), канари/шадоу, өз runtime.
vLLM/TGI (LLM): continuous batching, KV-кэш, алып-сатарлык декодинг.
Fichestor: online (ms-SLA) + fich ырааттуулук үчүн offline (feature parity).

Мисал KServe-канари (идея):
yaml apiVersion: serving. kserve. io/v1beta1 kind: InferenceService metadata: { name: fraud }
spec:
predictor:
canaryTrafficPercent: 15 model:
modelFormat: { name: triton }
storageUri: s3://models/fraud/v3. 2. 1/
resources: { limits: { nvidia. com/gpu: "1" } }

4) Релиздер стратегиялары

Blue-Green: эки бирдей стек, заматта жол которуу, жөнөкөй артка.
Canary: SLO/сапаты боюнча трафиктин акырындык менен көбөйүшү (1% → 5% → 25% → 100%).
Көлөкө: жаңы модель трафиктин көчүрмөсүн алат, жооптор эч нерсеге таасир этпейт - коопсуз баа берүү.
A/B-тесттер: бизнес-метрика өлчөө (conversion, сактоо), статистикалык мааниси.

Роутинг эрежелеринин мисалы (psevdo-NGINX):

map $request_id $route {
default old;
"~ canary" new; # 5-15% by flag/cook/feature-toggle
}

5) SLO жана жумушчу бюджеттер

Онлайн антифрод/жекелештирүү: p95 ≤ 100-150 мс, p99 ≤ 250-400 мс.
LLM ipuçları (128-512 токендер): p95 ≤ 300-800 ms биринчи токендерди өндүрүү, tokens/s максаттуу ≥.
Жеткиликтүү: ≥ 99. критикалык жолдор үчүн 9%.
Сапаты: AUC/PR-AUC/Top-K @N ≥ босого;% уулуу/туура эмес жооптор ≤ X.
Баасы: $/1k суроо же $/1k токендер - бюджеттин ичинде.

6) CI/CD моделдер үчүн

Конвейер:

1. Train/finetune → реестрдеги модели (метадеректер: маалыматтар/код/метрика/лицензия).

2. Pack & Validate: бирдик тесттер Preprot ./Post., API шайкештиги, жүктөө тесттер (latency/tokens/s).

3. Canary Deploy: 1-5% жол; байкоо (SLO/сапаты/наркы).

4. критерийлер боюнча Promote/Rollback.

GitHub Actions үзүндүсүнүн мисалы (идея):
yaml jobs:
build-serve:
steps:
- run: make export_onnx && make docker_build
- run: pytest tests/serve --maxfail=1
- run: python perf_check. py --p95 120 --fail-on-regress
- run: kubectl apply -f kserve-canary. yaml

7) оптималдаштыруу кечигүү жана өткөрүү

Batching/mikrobatching (Triton/vLLM), суроолор параллелизми, pre-/post-processing CPU.
калибрлөө менен Kvanting (INT8/FP8/INT4); TensorRT/ONNX Runtime компиляция.
Кэширование: fich (online-fichestor/Redis), натыйжалары жана LLM үчүн KV-кэш.
Warmup: жылытуу тараза/деплой кэш; Автоскейл үчүн "жылуу" идиштер.
Убакыт-бюджет: эрте токтотуу, Токендерди чектөө/бим, температураны ылайыкташтыруу.

8) байкоо: телеметрия, дрейф, сапаты

SRE-метр: RPS, P50/P95/P99, каталар (5XX/4XX), GPU/CPU Util, эс, кезек, batch-fill.
ML-метрика: AUC/PR-AUC, calibration error, coverage, tokens/s, жооп узундугу, кэш-хит.
Drift: PSI/JS-divergence кирүү/чеп, мониторинг бөлүштүрүү жылышы; Алерталар.
Сапаты Online: контролдук алтын мисалдар, семплинг жооптор, LLM үчүн автоматтык RAG-score/уулуу.
Журнал: prompt/жооп (атын атагысы келбеген), trace_id, модель версия.

Мисал Prometheus (идея):

inference_latency_ms_bucket{model="fraud-v3. 2. 1",le="100"} 12345 inference_qps{model="fraud-v3. 2. 1"} 450 tokens_per_second{model="llm-help-v1"} 210

9) Чичтерди башкаруу жана шайкештик

Feature-parity: ошол эле offline/online өзгөртүү; код катары Fich нускасын.
Online Fichestor: ms-SLA, TTL, upsert, idempotency; тейлөө жакын кэш.
Backfill/refresh: онлайн эсеби оффлайн өлчөгүчтөр менен айырмаланбашы үчүн план.

10) Коопсуздук, PII жана лицензия

PII: tokenization/камуфляж, региондор боюнча сегменттөө (EU/TR/LATAM), тынч/транзиттик шифрлөө.
Сырлар/ачкычтар: KMS/Secrets Manager, сүрөттөрдө эч кандай сыр жок.
LLM саясаттары: мазмун чыпкалары, коопсуз stopper, red-teaming.
Лицензиялар: датасет/салмак шарттарын, редистрибуцияга/коммерцияга тыюу салууларды текшериңиз.
Изоляция: namespace-RBAC, квота, GPU бассейндери үчүн taints/tolerations.

11) Autoscale жана QoS

Autoscaling: RPS/кезек/latency/GPU-util; min-ready-pods ысык линиялар үчүн.
QoS класстар: сын онлайн (anti-fraud)> LLM чат> эксперименттер. Preemption сын пайдасына.
Мультирегион: latency-based routing, жылытылган салмак кэш, репликация fich.

12) Runbooks жана окуялар

p99 өсүшү: текшерүү batch-fill, кезек, GPU-util, кэш-miss; агрессивдүү батчинг/beam/токендерди төмөндөтүү.
Сапаты төмөндөдү: мурунку версиясына артка чегинүү, көлөкөнү күйгүзүү, дрейф булактарын бекитүү.
Баасы өсүп жатат :/TensorRT Quantisation киргизүү, чүчүкулак жогорулатуу, чүчүкулак/кэш оптималдаштыруу, RAG/натыйжасы-кэш аркылуу LLM-генерация жыштыгын азайтуу.
PII-окуя: токтоосуз stop-the-line, артефакттарды кайра чакыртып алуу, жеткиликтүүлүк аудити, жол-жобосу боюнча жөнгө салуучу органга отчет.

13) үлгүлөрү мисалдар

Triton - динамикалык батчинг (фрагмент):
text dynamic_batching { preferred_batch_size: [4, 8, 16, 32]
max_queue_delay_microseconds: 2000 }
instance_group { kind: KIND_GPU count: 2 }
vLLM ишке киргизүү (идеялар):

--tensor-parallel-size 2
--max-num-seqs 512
--gpu-memory-utilization 0. 9
API шайкештигин текшерүү (псевдокод):
python resp = client. score({"features": f}) # v3. 2. 1 assert set(resp. keys()) >= {"score","version","latency_ms"}

14) Киргизүү чек-тизмеси

1. SLO/SLA (latency/availability/quality/cost) аныктоо.
2. Артефакттарды жана моделдердин реестрин стандартташтырыңыз (версиялар, метадеректер).
3. Тандоо кызматы (Triton/KServe/vLLM) жана fichestor.
4. Canary/блю-грин/shadow жана автоматтык гейтс орнотуу.
5. CI/CD куруу: шайкештик тесттер, перф-регрессия, коопсуз промоушен.
6. байкоо киргизүү (SRE + ML-метрика), дрейф мониторинг жана алерталар.
7. PII/коопсуздук/лицензия жана аудит менен камсыз кылуу.
8. Autoscale/QoS жана көп региондук саясатты орнотуу.
9. Runbook даярдоо жана оюн-күнү өткөрөт.
10. Чыгымдарды башкарууну киргизиңиз: батчинг, квантизация, кэш, RAG.

15) Антипаттерндер

Деплой "бар" жок канари/байкоо → күтүлбөгөн окуялар.
Макулдашылбаган Чичи offline/online → айырмачылыктар метриктер.
Перф-тесттердин жана чектөөлөрдүн жоктугу → p99 "калкып".
Anonymous → PII тобокелдик жок prompt/жооп Логин.
Бир жалпы GPU бассейн бардык жок QoS → сынчыл онлайн азап.
Эч кандай кайтарым жана snapshots artefacts → узак токтоп.

Натыйжалары

ML моделдерин ийгиликтүү жайгаштыруу контейнерлештирилген экспонаттар, стандартташтырылган тейлөө, коопсуз релиз процесси (canary/blue-green/shadow), катуу SLO жана сапаты/drift/наркы байкоо болуп саналат. Fichestor, perf-gates, PII-гигиена, Autoscale жана QoS менен CI/CD кошуу - жана сиздин AntiFrod/персоналдаштыруу/LLM кызматтары p99 жана бюджет боюнча болжолдонгон бойдон iGaming жогорку жүктөрдү туруктуу сактап калат.

Contact

Биз менен байланышыңыз

Кандай гана суроо же колдоо керек болбосун — бизге кайрылыңыз.Биз дайым жардам берүүгө даярбыз!

Telegram
@Gamble_GC
Интеграцияны баштоо

Email — милдеттүү. Telegram же WhatsApp — каалооңузга жараша.

Атыңыз милдеттүү эмес
Email милдеттүү эмес
Тема милдеттүү эмес
Билдирүү милдеттүү эмес
Telegram милдеттүү эмес
@
Эгер Telegram көрсөтсөңүз — Emailден тышкары ошол жактан да жооп беребиз.
WhatsApp милдеттүү эмес
Формат: өлкөнүн коду жана номер (мисалы, +996XXXXXXXXX).

Түшүрүү баскычын басуу менен сиз маалыматтарыңыздын иштетилишине макул болосуз.