Logo GH

部署ML模型

(部分: 技术和基础设施)

简短摘要

可靠的ML生产部署是以下内容的集合:可重复工件(模型/代币/配料),标准化伺服器(Triton/KServe/vLLM),安全发布过程(金丝雀/蓝绿色/阴影),可观察性(潜伏性,质量,漂移)和事件运行手册。对于iGaming来说,关键是低延迟(反亲和力/个性化),严格的SLO,PII/合规性和成本控制。

1)部署模式

Batch(离线):夜间/每小时作业(评分回顾、片段更新)。便宜,可预见。
在线(同步API):防冻,个性化,推荐,LLM提示。需要p95 SLA(例如≤ 100-300毫秒)。
Stream(近实时):用于CRM信号和触发器的窗口1-60秒(Flink/Spark/Kafka Streams)。
溷合动力:在线快速粗糙速率+离线重新计算/校准。

2)文物和包装

模型工件:重量,标记器,预处理/后处理预针,dataset/代码版本。
格式:PyTorch/TF SavedModel,用于兼容性的ONNX,用于加速的TensorRT引擎,用于LLM量化的GGUF/awq/gptq。
容器:带有针刺依赖性的Docker OCI图像;多平台标签(CPU/GPU)。

Immutable发行版: 标记'model: fraud-v3.2.1`, `image: fraud:3.2.1`.

3)伺服平台

Triton Inference Server:多模式,动态战斗,合奏管道。
KServe(K8s本地):自动滑行(HPA/KPA),金丝雀/shadow,自己的运行时间。
vLLM/TGI(LLM):连续击球,KV缓存,投机解码。
Fichestor: online (ms-SLA)+offline for feature parity一致性。

KServe金丝雀示例(想法):
yaml apiVersion: serving. kserve. io/v1beta1 kind: InferenceService metadata: { name: fraud }
spec:
predictor:
canaryTrafficPercent: 15 model:
modelFormat: { name: triton }
storageUri: s3://models/fraud/v3. 2. 1/
resources: { limits: { nvidia. com/gpu: "1" } }

4)发布策略

Blue-Green:两个相同的堆栈、即时流量切换、简单的回滚。
金丝雀:SLO/质量游戏的流量逐渐增加(1% → 5% → 25% → 100%)。
影子:新模型获得通信的副本,答桉不影响-安全评估。
A/B测试:测量业务指标(转换,保留),统计意义。

路由规则的示例(伪NGINX):

map $request_id $route {
default old;
"~ canary" new; # 5-15% by flag/cook/feature-toggle
}

5)SLO和工作预算

在线反性/个性化:p95 ≤ 100-150毫秒,p99 ≤ 250-400毫秒。
LLM提示(128-512令牌):p95 ≤ 300-800毫秒生成第一个令牌,tokens/s ≥目标。
可用性:≥ 99。9%用于关键路径。
质量:AUC/PR-AUC/Top-K@N ≥阈值;有毒/不正确答案的百分比≤ X。
费用:$/1k查询或$/1k代币-在预算范围内。

6)型号的CI/CD

输送机:

1.火车/finetune →注册表中的模型(元数据:数据/代码/度量/许可证)。

2.Pack&Validate: unit prots./prots., API兼容性,负载测试(latency/tokens/s)。

3.金丝雀仓库:交通量的1-5%;可观察性(SLO/质量/成本)。

4.Promote/Rollback按标准游戏。

GitHub Actions片段的示例(想法):
yaml jobs:
build-serve:
steps:
- run: make export_onnx && make docker_build
- run: pytest tests/serve --maxfail=1
- run: python perf_check. py --p95 120 --fail-on-regress
- run: kubectl apply -f kserve-canary. yaml

7)优化延迟和吞吐量

Batching/microbatching (Triton/vLLM),查询并行性,CPU前/后处理。
校准量化(INT8/FP8/INT4);TensorRT/ONNX运行时汇编。
缓存:fich(online fichestor/Redis),结果和LLM的KV缓存。
Warmup:变质时加热/缓存;汽车牌的"温暖"垫。
超时预算:提前停止,令牌/节拍限制,温度适应。

8)可观察性: 遥测,漂移,质量

SRE指标:RPS,p50/p95/p99,错误(5xx/4xx),GPU/CPU util,内存,队列,batch-fill。
ML度量标准:AUC/PR-AUC, calibration error, coverage, tokens/s,响应长度,缓存命中。
漂移:PSI/JS在输入/分配上的差异,分布移位监测;Alertes。
在线质量:对照金色示例,响应采样,LLM的自动RAG得分/毒性。
日志:prompt/响应(匿名),trace_id,模型版本。

Prometheus的示例(想法):

inference_latency_ms_bucket{model="fraud-v3. 2. 1",le="100"} 12345 inference_qps{model="fraud-v3. 2. 1"} 450 tokens_per_second{model="llm-help-v1"} 210

9)基金管理和一致性

功能亲和力:向离线/在线的相同转换;将fici转换为代码。
在线fichestor:ms-SLA,TTL,upsert,idempotency;快取更接近伺服器。
Backfill/refresh:确保在线评分与离线度量标准不冲突的计划。

10)安全,PII和许可证

PII:令牌/掩蔽,按区域划分(EU/TR/LATAM),静止/过境加密。
秘密/密钥:KMS/Secrets Manager,图像中没有秘密。
LLM策略:内容过滤器,安全塞子,红色团队。

许可证: 检查datasets/重量的条件,禁止重新分区/商业.

隔离:namespace-RBAC,配额,GPU池的taints/tolerations。

11) Autoscale和QoS

Autoscaling:通过RPS/队列/latency/GPU-util;热线的min-ready-pods。
QoS类:关键的在线(anti-fraud)> LLM聊天>实验。提前支持关键。
多区域:基于latency的路由,变暖的重量缓存,幻想复制。

12) Runbooks和事件

P99的增长:检查batch-fill,队列,GPU-util,缓存小姐;启用激进的战斗/降级beam/令牌。
质量下降:回滚到以前的版本,包括阴影,固定漂移源。
成本不断增长:启用量化/TensorRT,提高对接,优化对接/缓存,通过RAG/结果缓存降低 LLM生成频率。
PII事件:立即停止,召回文物,访问审计,向监管机构报告程序。

13)模式示例

Triton-动态击球(片段):
text dynamic_batching { preferred_batch_size: [4, 8, 16, 32]
max_queue_delay_microseconds: 2000 }
instance_group { kind: KIND_GPU count: 2 }
vLLM启动(想法):

--tensor-parallel-size 2
--max-num-seqs 512
--gpu-memory-utilization 0. 9
API兼容性检查(伪代码):
python resp = client. score({"features": f}) # v3. 2. 1 assert set(resp. keys()) >= {"score","version","latency_ms"}

14)实施支票

1.定义SLO/SLA (latency/availability/quality/cost)。
2.标准化工件和模型注册表(版本、元数据)。
3.选择伺服堆栈(Triton/KServe/vLLM)和fichestor。
4.调整金丝雀/蓝绿色/影子和自动门。
5.构建CI/CD:兼容性测试,perf回归,安全升级。
6.启用可观察性(SRE+ML度量)、漂移监视和异常值。
7.提供PII/安全/许可证和审核。
8.配置自动轨道/QoS和多区域政策。
9.准备一份运行手册并度过游戏日。
10.输入成本管理:战斗、量化、缓存、RAG。

15)反模式

Deploy"原样"没有金丝雀/可观察性→意外事件。
离线/在线不一致的fici →度量差异。
没有Perf测试和限制→ p99"浮动"。
在不匿名的情况下编写计划/响应→ PII风险。
一个普通的GPU池适用于没有QoS的所有人→关键的在线问题。
文物没有回滚,没有狙击→停机时间很长。

结果

ML模型的成功部署包括容器化工件,标准化伺服器,安全释放过程(金丝雀/蓝绿色/阴影),刚性SLO和质量/漂移/成本观察。添加fichestor、CI/CD和perf gates、PII卫生、autoscale和QoS-您的防冻剂/个性化/LLM服务将始终保持iGaming的峰值负载,同时保持p99和预算的可预测性。

Contact

联系我们

如需任何咨询或支持,请随时联系我们。我们随时准备提供帮助!

Telegram
@Gamble_GC
开始集成

Email — 必填。Telegram 或 WhatsApp — 可选

您的姓名 可选
Email 可选
主题 可选
消息内容 可选
Telegram 可选
@
如果填写 Telegram,我们也会在 Telegram 回复您。
WhatsApp 可选
格式:+国家代码 + 号码(例如:+86XXXXXXXXX)。

点击按钮即表示您同意数据处理。