Logo GH

Ҷойгиркунии моделҳои ML

(Қисм: Технология ва инфрасохтор)

Хулосаи мухтасар

Ҷойгиркунии боэътимоди истеҳсоли ML ин маҷмӯаи: артефактҳои такрорӣ (модел/токенизатор/конфиг), серфинги стандартишуда (Triton/KS berve/vLLM), раванди озодкунии бехатар (канарӣ/кабуди сабз/соя), мушоҳидаҳо (ниҳонӣ, сифат, дрифт) ва дафтарчаҳо оид ба ҳодисаҳо. Таъхир дар сатҳи паст (зидди қаллобӣ/фардикунонӣ), SLO-и қатъӣ, PII/мутобиқат ва назорати хароҷот барои IGaming муҳим мебошанд.

1) Усулҳои ҷойгиркунӣ

Гурӯҳ (офлайн): вазифаҳои шабона/соат (баҳодиҳии ретроспективӣ, навсозии сегментҳо). Арзон, пешгӯишаванда.
Онлайн (синхронии API): зидди қаллобӣ, фардикунонӣ, тавсияҳо, маслиҳатҳои LLM. Талаб мекунад p95 SLA (масалан, ≤ 100-300 мс).
Ҷараён (дар вақти воқеӣ): тирезаҳои 1-60 сония (ҷараёнҳои Flink/Spark/Kafka) барои сигналҳои CRM ва триггерҳо.
Гибрид: холҳои тези онлайн + ҳисобкунии офлайнӣ/калибрченкунӣ.

2) Артефактҳо ва банду баст

Артефактҳои моделӣ: вазнҳо, токенизатор, конфигуратсияҳои коркард/коркарди пас аз коркард, нусхаи маҷмӯа/код.

Форматҳо: Py

Зарфҳо: Тасвирҳои Docker OCI бо вобастагии пинҳоншуда; барчаспҳои бисёр платформа (CPU/GPU).
Варақаҳои тағйирнопазир: модели барчасп: қаллобӣ-v3. 2. 1 ',' тасвир: қаллобӣ: 3. 2. 1`.

3) Платформаи хидматрасонӣ

Сервери Triton Inference: бисёр модел, қассобии динамикӣ, ансамбль-қубурҳо.
KS berve (K8s-модарӣ): миқёси худкор (HPA/KPA), канарӣ/соя, вақти кории худ.
vLLM/TGI (LLM): ҷобаҷогузории доимӣ, кэши КВ, рамзкушоии спекулятивӣ.
Fichestor: онлайн (ms-SLA) + офлайн барои паритети хусусият.

Намунаи KS berve-канарӣ (идея):
yaml apiVersion: serving. kserve. io/v1beta1 kind: InferenceService metadata: { name: fraud }
spec:
predictor:
canaryTrafficPercent: 15 model:
modelFormat: { name: triton }
storageUri: s3://models/fraud/v3. 2. 1/
resources: { limits: { nvidia. com/gpu: "1" } }

4) Стратегияҳои озодкунӣ

Кабуд-Сабз: ду стекҳои якхела, гузариши фаврии трафик, гардиши оддӣ.
Канария: трафики тадриҷан афзоишёбанда (1% → 5% → 25% → 100%) дар байни дарвозаҳои SLO/сифат.
Соя: Модели нав нусхаи трафикро мегирад, посухҳо ба ҳеҷ чиз таъсир намерасонанд - сметаи бехатар.
Санҷишҳои A/B: мо ченакҳои тиҷоратро (табдил, нигоҳдорӣ), аҳамияти омориро чен мекунем.

Намунаи қоидаҳои масир (псевдо-NGINX):

map $request_id $route {
default old;
"~ canary" new; # 5-15% by flag/cook/feature-toggle
}

5) SLO ва буҷаҳои амалиётӣ

Анти-қаллобӣ/фардикунонии онлайн: p95 ≤ 100-150 ms, p99 ≤ 250-400 ms.
LLM ишора мекунад (128-512 токен): p95 ≤ 300-800 мс насли нишонаҳои аввал, нишонаҳо/s ≥ ҳадаф.
Мавҷудият: ≥ 99. 9% барои роҳҳои интиқодӣ.
Сифат: ҳадди AUC/PR-AUC/Top-K @ N ≥;% ҷавобҳои заҳролуд/нодуруст ≤ X.
Арзиш: дархостҳои $/1k ё нишонаҳои $/1k - дар доираи буҷа.

6) CI/CD барои моделҳо

Конвейер:

1. Модели қатора/finetune → дар феҳрист (метамаълумот: маълумот/код/ченак/литсензия).

2. Бастабандӣ ва тасдиқкунӣ: санҷишҳои воҳид пеш/пост, мутобиқати API, санҷишҳои сарборӣ (latency/tokens/s).

3. Ҷойгиркунии канарӣ: 1-5% трафик; мушоҳида (SLO/сифат/арзиш).

4. Мусоидат/баргардонидан аз рӯи дарвозаҳои меъёрӣ.

Намунаи як порчаи амалҳои GIT Hub (ғоя):
yaml jobs:
build-serve:
steps:
- run: make export_onnx && make docker_build
- run: pytest tests/serve --maxfail=1
- run: python perf_check. py --p95 120 --fail-on-regress
- run: kubectl apply -f kserve-canary. yaml

7) Оптимизатсияи таъхир ва интиқол

Triton/vLLM, мувофиқати дархост, коркарди пеш аз/пас аз CPU.
Квантизатсия (INT8/FP8/INT4) бо калибрченкунӣ; Маҷмӯаи TensorRT/ONNX Runtime.
Кэшинг: хусусият (онлайн-хусусият/Редис), натиҷаҳо ва кэши KV барои LLM.
Гармӣ: гарм кардани тарозу/кэш ҳангоми партофтан; оташдонҳои autoscale "гарм".
Буҷаи вақт: таваққуфи барвақт, лимити нишона/чӯб, мутобиқшавии ҳарорат.

8) Мушоҳида: телеметрия, дрифт, сифат

Нишондиҳандаҳои SRE: RPS, p50/p95/p99, хатогиҳо (5xx/4xx), GPU/CPU util, хотира, навбат, партия-пур.
Нишондиҳандаҳои ML: AUC/PR-AUC, хатои калибрченкунӣ, фарогирӣ, нишонаҳо/с, дарозии посух, зарбаи кэш.
Дрифт: Фарқияти PSI/JS аз рӯи воридот/хусусиятҳо, мониторинги гузариши тақсимот; ҳушдор медиҳад.
Сифати онлайн: Ҳолатҳои санҷиши тиллоӣ, интихоби ҷавоб, автоматии RAG-хол/заҳролудшавии LLM.
Воридшавӣ: фаврӣ/вокуниш (беном), trace_id, нусхаи намунавӣ.

Намунаи Прометей (идея):

inference_latency_ms_bucket{model="fraud-v3. 2. 1",le="100"} 12345 inference_qps{model="fraud-v3. 2. 1"} 450 tokens_per_second{model="llm-help-v1"} 210

9) Идоракунии хусусиятҳо ва пайдарҳамӣ

Хусусият-паритет: ҳамон дигаргуниҳои офлайнӣ/онлайн; хусусиятҳои версия ҳамчун рамз.
Fichestor онлайн: ms-SLA, TTL, upsert, idempotency; кэш ба серфинг наздиктар аст.
Backfill/refresh: Нақшаи нигоҳ доштани холҳои онлайн аз фарқият аз ченакҳои офлайнӣ.

10) Амният, PII ва литсензияҳо

PII: токенизатсия/ниқоб, тақсимот аз рӯи минтақа (EU/TR/LATAM), рамзгузорӣ дар истироҳат/транзит.
Асрҳо/калидҳо: Менеҷери KMS/Secrets, сирри тасвирҳо нест.
Сиёсати LLM: филтрҳои мундариҷа, таваққуфҳои бехатар, дастаи сурх.
Литсензияҳо: шартҳои санҷиши маълумотҳо/вазнҳо, манъи тақсимоти/тиҷорат.
Ҷудокунӣ: фазои ном-RBAC, квотаҳо, обҳо/таҳаммулпазирӣ барои ҳавзҳои GPU.

11) Autoscale ва QOS

Autoscaling: бо RPS/навбат/ниҳонӣ/GPU-util; min-омода-pods барои хати доимоамалкунанда.
Дарсҳои QOS: онлайн танқидӣ (зидди қаллобӣ)> Чат LLM> таҷрибаҳо. Афзалият ба манфиати интиқодӣ.
Бисёр минтақаҳо: масир дар асоси таъхир, кэшҳои вазни гармшуда, такрори хусусиятҳо.

12) Китобчаҳо ва ҳодисаҳо

афзоиши p99: пур кардани партия, навбат, GPU-util, пазмони кэш; фаъол кардани қассобии хашмгин/чӯбчаи поёнӣ/токенҳо.
Сифат паст шуд: бозгашт ба версияи қаблӣ, сояро фурӯзон кунед, манбаъҳои дрифтро ислоҳ кунед.
Арзиш меафзояд: имкон диҳед, ки миқдор/TensorRT, партияро зиёд кунед, хусусият/кэшро оптимизатсия кунед, басомади наслҳои LLM-ро тавассути кэши RAG/натиҷа кам кунед.
Ҳодисаи PII: фавран таваққуф, бозхонди артефакт, аудити дастрасӣ, гузориши тартиб ба танзимгар.

13) Намунаҳои намуна

Тритон - бастабандии динамикӣ (порча):
text dynamic_batching { preferred_batch_size: [4, 8, 16, 32]
max_queue_delay_microseconds: 2000 }
instance_group { kind: KIND_GPU count: 2 }
Оғози (идеяҳои) VLLM:

--tensor-parallel-size 2
--max-num-seqs 512
--gpu-memory-utilization 0. 9
Санҷиши мутобиқати API (рамзи псевдо):
python resp = client. score({"features": f}) # v3. 2. 1 assert set(resp. keys()) >= {"score","version","latency_ms"}

14) Рӯйхати назорати амалисозӣ

1. SLO/SLA-ро муайян кунед (таъхир/мавҷудият/сифат/арзиш).
2. Стандартикунонии артефактҳо ва феҳристи моделҳо (версияҳо, метамаълумот).
3. Анбори хизматиро интихоб кунед (Triton/KS berve/vLLM) ва fichester.
4. Насб кардани канарейкаҳо/кабуди сабз/соя ва дарвозаҳои худкор.
5. Сохтани CI/CD: санҷишҳои мутобиқат, регрессияи перф, таблиғи бехатар.
6. Мушоҳидаҳоро (ченакҳои SRE + ML), мониторинги дрифт ва огоҳиҳоро дар бар гиред.
7. Таъмини PII/амният/литсензияҳо ва аудит.
8. Танзими сиёсати autoscale/QOS ва бисёр минтақаҳо.
9. Runbook-ро омода кунед ва рӯзи бозӣ дошта бошед.
10. Идоракунии хароҷотро ворид кунед: қассобӣ, миқдорӣ, кэш, RAG.

15) Антипаттернҳо

Ҷойгиркунии "чӣ тавре ки" бидуни канарӣ/мушоҳидакорӣ → ҳодисаҳои ғайричашмдошт.
Хусусиятҳои номувофиқ дар офлайн/онлайн § номутобиқатии метрӣ.
Набудани санҷишҳои perf ва маҳдудиятҳои → p99 "шино".
Сабти номҳо/посухҳо бидуни беном кардан → хатари PII.

Як ҳавзи маъмулии GPU барои ҳама чиз бидуни Qo

Ягон лағжиш ва аксҳои артефактҳо § муддати тӯлонӣ вуҷуд надоранд.

Хулоса

Ҷойгиркунии бомуваффақияти моделҳои ML ин артефактҳои контейнерӣ, хидматрасонии стандартӣ, раванди бехатари озодкунӣ (канарӣ/кабуд-сабз/соя), SLO-ҳои сахт ва мушоҳидаи сифат/дрифт/хароҷот мебошанд. Fichestore, CI/CD-ро бо дарвозаҳои perf, гигиенаи PII, autoscale ва QOS илова кунед - ва хидматҳои зидди қаллобӣ/фардикунонӣ/LLM шумо пайваста сарбории баландтарини IGaming-ро нигоҳ медоранд, дар ҳоле ки дар p99 ва буҷа пешгӯишаванда боқӣ мемонанд.

Contact

Тамос гиред

Барои саволҳо е дастгирӣ ба мо муроҷиат кунед.Мо ҳамеша омодаем!

Telegram
@Gamble_GC
Оғози интегратсия

Email — муҳим аст. Telegram е WhatsApp — ихтиерӣ.

Номи шумо ихтиерӣ
Email ихтиерӣ
Мавзӯъ ихтиерӣ
Паем ихтиерӣ
Telegram ихтиерӣ
@
Агар Telegram нависед — ҷавобро ҳамон ҷо низ мегиред.
WhatsApp ихтиерӣ
Формат: рамзи кишвар + рақам (масалан, +992XXXXXXXXX).

Бо фиристодани форма шумо ба коркарди маълумот розӣ ҳастед.