Logo GH

サンプリングと表現性

サンプリングと表現性

サンプリングは、測定、実験、およびモデルトレーニングのための観測のサブセットの選択です。表示性とは、サンプルからの結論がバイアスなしでターゲット集団にスケールされることを意味します。以下は、サンプルを設計し、その品質を評価し、オフセットを修正する方法です。

1)基本的な概念

人口:オブジェクトのターゲットセット(すべてのユーザー/セッション/トランザクション)。
サンプリングフレーム:実際に選択したリスト/メカニズム(コーティングと「穴」を識別することが重要です)。
選択単位:ユーザー、セッション、イベント、トランザクション、デバイス。
表示性:サンプルと母集団のキー属性分布を一致させる(ランダムな誤差許容差を持つ)。
ランダムvsバイアス:推定値とバイアス(バイアス)の分散。

2)サンプリングの種類

2.1確率的(推奨)

SRS(単純なランダム):選択の等しい確率。
層別:層別人口(国/チャネル/プラットフォーム)、次に層内SRS→低分散とより良いカバレッジ。
クラスタ:グループの選択(日/サーバー/ストア);安いがより高いintraclusterの相関。
体系的:ランダム開始後のすべてのkth要素(「非同期」データが必要)。
PPS(サイズに比例する確率)-単位サイズ∝確率(パートナーのトラフィック量など)。

2.2信じられないほど(注意して)

アメニティ/ボランティア:迅速なアンケート、「クリック」ログ→選択バイアスのリスク。
クォータ/スノーボール:ニッチなグループで有用ですが、その後のキャリブレーションが必要です。

3)変位の源

カバレッジ:人口の一部はフレーム内にありません(追跡が禁止されている場合など)。
選択:選択メカニズムはターゲット変数に関連付けられています(より頻繁にアクティブになります)。
非応答:無反応は体系的に異なっています。
生存者:出発/ブロックされたを無視します。
オフセットラベル:騒々しいタグ、プロキシラベル、「手動」調整。
顔:サンプル/フィーチャーの形成における将来の情報の使用。

4)サンプルのサイズおよび力

4.1近似値

精度(e)と信頼度(1-\alpha)の分数(p):
[
n\approx\frac {z_{\alpha/2}^2、 p (1-p)} {e^2}
]

我々は保守的に(p=0{。}5)となっている。必要に応じて最終的な人口を調整します。

既知の媒体(\sigma)の場合:
[
n\approx\left (\frac {z_{\alpha/2} 、\sigma} {e }\right)^2
]

4.2設計効果および有効なサイズ

設計効果:(\mathrm {Deff}=1+(m-1 )\rho)、ここで(m)はクラスタサイズ、(\rho)は内部クラスタ相関である。
有効なサイズ:(n_\text{eff}=n/\mathrm{Deff})。クラスタ/重み付けされた設計では、多くの場合、より多くの(n)が必要です。

4.3 A/BおよびMDE

対称グループを持つバイナリメトリックの場合:
[
n_{\text{на\approx\frac {2 (z_{1-\alpha/2}+z_{1-\beta})^2 、\bar {p} (1-\bar {p})} {\mathrm {MDE}^2}
]

(\bar {p})がベースレベルである場合、MDEは最小限に検出可能な効果である。
季節性と干渉(スピルオーバー)を考慮し、分散を減らすためにCUPED/共変量を適用します。

5)重量および口径測定(私達は人口に「類似した」サンプル)

設計重量:(w_i=1/\pi_i)(選択の逆確率)。
層別化とレイキング:加重限界(国/プラットフォーム/ジェンダー年齢など)を既知の分数に調整します。
口径測定の重量を量ること:制御合計と丁度一致するとき重量の偏差を最小にして下さい。
ブートストラップ/レプリケーション:重みの分散の正確な推定。
診断:ESS(有効なサンプルサイズ)、重量の広がり(CV、 p95/p5)、主要な特徴による比較の前後。

6)クラスの不均衡およびまれなでき事

ターゲットによる層別選択:オーバーサンプルはまれなクラスですが、トレーニングでは常に閾値/重量調整を使用します。
費用に敏感な学習:合成の代わりに重み付けされた損失。
SMOTE/ADASYN:注意-漏洩/アーティファクトのリスク;厳密な時間/グループの分割を保って下さい。
評価:PR-AUC、 Recall@FPR ≤ x%;確率キャリブレーション。

7)ストリーミングとビッグデータ

リザーバサンプリング:未知の長さのストリームからの代表的なサブセットを保持します。
イベントサンプリング:周波数/重要度に比例します。まれ-トリガーバッファ。
カウンターおよびスケッチ:頻度/独自性のためのBloom/Count-Min;分析のために-周期的な正確なカウントと結合して下さい。
dupとidempotency-イベントキー、重複除外ウィンドウ。

8)時間的および空間的側面

時間ベースのサンプリング:固定ウィンドウ(ローリング)、ポイント・イン・タイムの正確さ。
クラスタ/ジオサンプリング:ノード/リージョンによるクラスタリング;空間的自己相関を考えてみましょう。
季節性/リズム:週/休日の時間/日の代表的なカバレッジ。

9)オフポリシー/ログデータと因果関係

IPS(逆向き):(w_i=1/\pi (a_ix_i))新しいポリシーのログサンプルを修正する。
DRスコア:バイアスと分散を低減するための二重堅牢性。
トランスポータビリティ-市場/チャネル間で結果を転送する-共変シフトを確認する
ラベルシフト:(P (y))安定時の変化(P (x)y));EM/recalibrationを使用して下さい。

10)表現力診断

限界比較:キー属性によるテーブル群とサンプル群。
共変のバランス:SMD(標準化された平均差)、愛のプロット。
密度/量:KSテスト、quantile-plots、 PSI。
モデル認定:アウト・オブ・タイムおよびアウト・オブ・ドメインスライスのメトリックの安定化。
ESSおよび重量:低いESSはスコアの高い分散を信号します。

11)アンチパターン

「サンプルのみアクティブ昨日」→寒さ/眠りの損失。
平均パーセンテージ「セグメント平均」重みなし。
集計レベル(イベントとユーザー)を1つのサンプルにミックスします。
ターゲットに依存するフィルタの後のランダムな選択(結果の選択)。
グループ/タイムスプリットのないクロスバルは、依存するデータで分割します。
電車/バル(漏れ)の前にSMOTEを適用します。

12)プライベートシナリオ(ケース)

プレーヤーの調査:国/プラットホーム/年齢によって層別化される;MAU株式への層別化。非応答オフセット制御。
EDAのログ:体系的な1:Nイベントサンプル+希少型の完全なカバレッジ。

不正検出: ターゲット層別化、コスト感度の高い損失、PR-AUCスコア、Recall@FPR ≤ x%

制限されたトラフィックを持つA/B: MDE計算、電源規則の更新、CUPED。
オフポリシー評価プロモーション:重量制限付きIPS/DR(トリミング)、サポートオーバーラップチェック。

13)アーティファクトパターン

サンプリングプラン(テンプレート)

ターゲット/人口: ……

サンプリングボックス: ソース、カバー/穴

選択単位: ユーザー/セッション/イベント

デザイン: ストラタ(国、プラットフォーム)、株式、選択方法

サイズ(n): 計算、仮定(α、力、MDE)、デフ

重量スキーム: 設計重量、層別化(制御合計)

カレンダー: 日/時間/休日のカバレッジ

品質: カバレッジテスト、ノンレスプラン、コンタクト手順

リスク: 選択、干渉、プライバシー/PII

所有者と管理者: カウント/ストア/バージョン

計量パスポート(テンプレート)

基礎重量: (w_i=1/\pi_i)

校正: 目標(国、プラットフォーム、年齢)、方法(レーキング)、公差

制限: トリミングw ∈ [w_min、 w_max]

診断: ESS、 CV (w)、前後のSMD

使用法: どのレポート/モデルが重みを適用するか

バージョン: v1→v2、日付、所有者

14)プライバシーと倫理

設計によるプライバシー:フィールド最小化、集計、匿名化。
差分プライバシー:プライバシー増幅としてランダム化/サブサンプリング。
公平さ:敏感な属性に対して間違い/重量の相違を点検して下さい;「見えない」グループを許可しないでください。

15)プレスタートチェックリスト

  • サンプリングボックスについて説明します。識別され、文書化されるコーティングの穴
  • 選択された設計(strata/clusters)、計算(n)、デフ、MDE
  • 設計重量と校正計画の設定(制御合計合意)
  • 時間ウィンドウ/季節性が定義されています。無反応による計画があります
  • 検証分割は時間/グループを考慮する。リークなし
  • 品質指標:ESS、 SMD、 PSI、ブートストラップ間隔
  • ドキュメントとバージョン;アクセス権とプライバシーコントロールのチェック

ミニ用語集

デフ:マルチプライヤーは、デザインによるスコアの分散を増加させます。
ESS:重量を量ることの後の有効なサンプルサイズ。
IPS/DR:ポリシー外/ログデータの重み付け方法。
SMD:標準化された平均差(共変バランス)。
リザーバサンプリング:ストリームからランダムなサンプルを維持します。

合計

表現性は「サンプルに幸運」ではなく、設計されたプロセスです。正しいフレーム、思慮深い選択デザイン、十分なサイズ、計量と校正、正直な分割と厳密な診断。説明した慣行に従うことで、バイアスを減らし、結論の移植性を高め、製品、マーケティング、リスク、およびMLの信頼性の高いソリューションを得ることができます。

Contact

お問い合わせ

ご質問やサポートが必要な場合はお気軽にご連絡ください。いつでもお手伝いします!

Telegram
@Gamble_GC
統合を開始

Email は 必須。Telegram または WhatsApp は 任意

お名前 任意
Email 任意
件名 任意
メッセージ 任意
Telegram 任意
@
Telegram を入力いただいた場合、Email に加えてそちらにもご連絡します。
WhatsApp 任意
形式:+国番号と電話番号(例:+81XXXXXXXXX)。

ボタンを押すことで、データ処理に同意したものとみなされます。