Logo GH

MLモデルの展開

(セクション: 技術とインフラ)

概要

信頼できるML生産展開は、反復可能なアーティファクト(モデル/トークナイザー/構成)、標準化されたサーフィン(Triton/KServe/vLLM)、安全なリリースプロセス(カナリア/ブルーグリーン/シャドウ)、観測性(レイテンシ、品質、ドリフト)、およびランブックのインシデントのコレクションです。低レイテンシー(不正防止/パーソナライゼーション)、厳格なSLO、 PII/コンプライアンス、およびコスト管理は、iGamingにとって重要です。

1)展開モード

バッチ(オフライン):夜間/時間タスク(レトロスペクティブのスコア、セグメントの更新)。安くて予測可能だ。
オンライン(同期API):不正防止、パーソナライゼーション、推奨事項、LLMのヒント。p95 SLAが必要です(例えば、≤ 100-300 ms)。
ストリーム(ほぼリアルタイム):CRM信号とトリガーのための1-60秒のウィンドウ(Flink/Spark/Kafkaストリーム)。
ハイブリッド:オンライン高速ラフスコア+オフライン再計算/キャリブレーション。

2)アーティファクトおよび包装

モデルアーティファクト:weights、 tokenizer、 preprocessing/postprocessing configs、 dataset/code version。
フォーマット:PyTorch/TF SavedModel、互換性のためのONNX、加速のためのTensorRTエンジン、LLM量子化のためのGGUF/awq/gptq。

コンテナ: ピン留めされた依存関係を持つDocker OCIイメージ;マルチプラットフォームタグ(CPU/GPU)

不変リリース: タグ付け'モデル:fraud-v3。2.1'、'画像:詐欺:3。2.1`.

3)サービングプラットフォーム

Triton推論サーバー:マルチモデル、ダイナミックバッチング、アンサンブルパイプライン。
KServe (K8s-native):自動スケール(HPA/KPA)、カナリア/シャドウ、独自のランタイム。
vLLM/TGI (LLM):連続バッチング、KVキャッシュ、投機的デコード。
Fichestor: online (ms-SLA)+offline for feature parity。

KServe-canaryの例(アイデア):
yaml apiVersion: serving. kserve. io/v1beta1 kind: InferenceService metadata: { name: fraud }
spec:
predictor:
canaryTrafficPercent: 15 model:
modelFormat: { name: triton }
storageUri: s3://models/fraud/v3. 2. 1/
resources: { limits: { nvidia. com/gpu: "1" } }

4)リリース戦略

ブルーグリーン:2つの同一スタック、インスタントトラフィックスイッチング、シンプルなロールバック。
カナリア州:SLO/品質ゲート間のトラフィック(1%→5%→25%→100%)を増やす。
影:新しいモデルはトラフィックのコピーを取得します、応答は何にも影響しません-安全な見積もり。
A/Bテスト:ビジネスメトリック(変換、保持)、統計的意義を測定します。

ルーティングルールの例(擬似NGINX):

map $request_id $route {
default old;
"~ canary" new; # 5-15% by flag/cook/feature-toggle
}

5) SLOと運用予算

オンライン詐欺防止/パーソナライゼーション:p95 ≤ 100-150 ms、 p99 ≤ 250-400 ms。
LLMヒント(128-512トークン):p95 ≤ 300-800 ms最初のトークン、トークン/s ≥ターゲットの生成。
空室状況:≥ 99。重大な経路のための9%。
品質:AUC/PR-AUC/Top-K@N ≥しきい値;%毒性/誤った応答≤ X。
コスト:$/1kリクエストまたは$/1kトークン-予算内。

6)モデルのためのCI/CD

コンベヤー:

1.トレイン/ファインチューン→レジストリ内のモデル(メタデータ:data/code/metrics/licenses)。

2.Pack&Validate: unit tests pre/post、 API互換性、ロードテスト(latency/tokens/s)。

3.カナリア配備:1-5%トラフィック;観測性(SLO/品質/コスト)。

4.基準ゲートによるプロモート/ロールバック。

GitHub Actions (idea)のフラグメントの例:
yaml jobs:
build-serve:
steps:
- run: make export_onnx && make docker_build
- run: pytest tests/serve --maxfail=1
- run: python perf_check. py --p95 120 --fail-on-regress
- run: kubectl apply -f kserve-canary. yaml

7)遅延とスループットの最適化

Triton/vLLM、リクエストコンカレンシー、CPUの前処理/後処理。
口径測定の量子化(INT8/FP8/INT4);TensorRT/ONNXランタイムコンパイル。
キャッシュ:機能(オンライン機能/Redis)、 LLMの結果とKVキャッシュ。
ウォームアップ:投棄中にスケール/キャッシュをウォームアップする。「暖かい」オートスケールハース。
時間予算:早期停止、トークン制限/ビーム、温度適応。

8)観測可能性: テレメトリー、ドリフト、品質

SREメトリクス:RPS、 p50/p95/p99、エラー(5xx/4xx)、 GPU/CPU util、メモリ、キュー、バッチフィル。
MLメトリック: AUC/PR-AUC、キャリブレーションエラー、カバレッジ、トークン/s、レスポンス長、キャッシュヒット。
ドリフト:入力/特徴、配分の転位の監視によるPSI/JSの発散;警告します。
オンライン品質:ゴールドテストケース、回答サンプリング、自動RAG スコア/LLM毒性。
ロギング:プロンプト/レスポンス(匿名化)、trace_id、モデルバージョン。

Prometheusの例(アイデア):

inference_latency_ms_bucket{model="fraud-v3. 2. 1",le="100"} 12345 inference_qps{model="fraud-v3. 2. 1"} 450 tokens_per_second{model="llm-help-v1"} 210

9)特徴管理および一貫性

特徴パリティ:同じオフライン/オンライン変換;バージョンはコードとして機能します。
オンラインfichestor: ms-SLA、 TTL、 upsert、 idempotency;キャッシュをサーフィンに近づけます。
Backfill/Refresh:オフラインメトリクスからオンラインのスコアを分散させる計画。

10)セキュリティ、PIIおよびライセンス

PII:トークン化/マスキング、地域別セグメンテーション(EU/TR/LATAM)、残り/通過時の暗号化。
秘密/鍵:KMS/Secrets Manager、画像に秘密はありません。
LLMポリシー:コンテンツフィルタ、安全ストッパー、レッドチーミング。
ライセンス:データセット/重みのチェック条件、再配布/商取引の禁止。
アイソレーション:名前空間RBAC、クォータ、GPUプールのテイン/許容。

11)オートスケールおよびQoS

オートスケーリング:RPS/queue/latency/GPU-util;ホットライン用のmin-ready-pods。
QoSクラス:オンラインクリティカル(不正防止)>LLMチャット>実験。批判に賛成して先制。
マルチリージョン:レイテンシーベースのルーティング、ウォームアップ重量キャッシュ、機能レプリケーション。

12)ランブックとインシデント

p99成長:バッチフィル、キュー、GPU-util、キャッシュミスをチェックします。アグレッシブバッチング/ロービーム/トークンを有効にします。
品質が低下:前のバージョンにロールバックし、影をオンにし、ドリフトのソースを修正します。
コストは増加しています:量子化/TensorRTを有効にし、バッチを増やし、機能/キャッシュを最適化し、RAG/結果キャッシュを介してLLM世代の周波数を削減します。
PIIインシデント:即時停止、アーティファクト・リコール、アクセス監査、レギュレータへのプロシージャ・レポート。

13)サンプルテンプレート

Triton-動的バッチ処理(フラグメント):
text dynamic_batching { preferred_batch_size: [4, 8, 16, 32]
max_queue_delay_microseconds: 2000 }
instance_group { kind: KIND_GPU count: 2 }
vLLMローンチ(アイデア):

--tensor-parallel-size 2
--max-num-seqs 512
--gpu-memory-utilization 0. 9
API互換性チェック(擬似コード):
python resp = client. score({"features": f}) # v3. 2. 1 assert set(resp. keys()) >= {"score","version","latency_ms"}

14)実装チェックリスト

1.SLO/SLA(レイテンシ/アベイラビリティ/品質/コスト)を定義します。
2.アーティファクトとモデルレジストリ(バージョン、メタデータ)を標準化します。
3.サービングスタック(Triton/KServe/vLLM)とファイスターを選択します。
4.カナリア/青の緑/影と自動ゲートを設定します。
5.ビルドCI/CD:互換性テスト、perf回帰、安全なプロモーション。
6.観測可能性(SRE+MLメトリック)、ドリフトモニタリング、アラートを含みます。
7.PII/セキュリティ/ライセンスと監査を提供します。
8.オートスケール/QoSポリシーとマルチリージョンポリシーを構成します。
9.ランブックを準備し、ゲームの日を持っています。
10.コスト管理:バッチング、クオンタイズ、キャッシュ、RAGを入力します。

15) Antipatterns

canary/observability→予期しないインシデントなしで「現状のまま」展開します。
オフライン/オンライン機能の矛盾→メートルの不一致。
perfテストとリミットがない→p99 "floats'。
匿名化→PIIリスクなしでプロンプト/応答をログに記録する。
QoS→クリティカルなオンラインなしのすべてのための1つの一般的なGPUプールが苦しんでいます。
アーティファクトのロールバックやスナップショットはありません→長いダウンタイム。

概要

MLモデルの導入に成功したのは、コンテナ化されたアーティファクト、標準化されたサービング、安全なリリースプロセス(カナリア/ブルーグリーン/シャドウ)、ハードSLO、品質/ドリフト/コストの観察です。PERFゲート、PII衛生、オートスケール、QoSを備えたfichestore、 CI/CDを追加すると、不正防止/パーソナライゼーション/LLMサービスは一貫してiGamingのピーク負荷を維持し、p99と予算で予測可能です。

Contact

お問い合わせ

ご質問やサポートが必要な場合はお気軽にご連絡ください。いつでもお手伝いします!

Telegram
@Gamble_GC
統合を開始

Email は 必須。Telegram または WhatsApp は 任意

お名前 任意
Email 任意
件名 任意
メッセージ 任意
Telegram 任意
@
Telegram を入力いただいた場合、Email に加えてそちらにもご連絡します。
WhatsApp 任意
形式:+国番号と電話番号(例:+81XXXXXXXXX)。

ボタンを押すことで、データ処理に同意したものとみなされます。