采樣和代表性
采樣和代表性
采樣是用於測量,實驗和模型訓練的觀測子集的選擇。代表性意味著從樣本中得出的結論在沒有系統錯誤的情況下擴展到目標人群。下面-如何設計樣本,評估其質量並調整位移。
1)基本概念
人口:目標對象集(所有用戶/會話/事務)。
采樣框架(采樣框架):我們實際從中采樣的列表/機制(重要的是要識別覆蓋物和「漏洞」)。
選擇單位:用戶、會話、事件、事務、設備。
代表性:樣本和人群中關鍵特征分布的匹配(具有隨機誤差可及性)。
隨機vs系統錯誤:估計值與位移的方差(bias)。
2)采樣類型
2.1概率(首選)
SRS(簡單隨機):相等選擇概率。
分層:將人口分成平流(國家/頻道/平臺),然後在平流層內進行SRS →低於方差,覆蓋範圍更好。
群集:群組選擇(天/服務器/商店);價格便宜,但高於集群內相關性。
系統性:隨機啟動後的每個k元素(需要「非同步」數據)。
PPS(可擴展大小)-∝ unit大小的概率(例如合作夥伴流量量)。
2.2不可思議(謹慎)
設施/誌願者:快速調查,「點擊」的日誌→選擇偏見的風險。
配額/雪球:在利基群體中有用,但需要後續校準。
3)位移源
覆蓋(coverage):框架中缺少部分人口(例如,禁止跟蹤時的iOS數據)。
選擇:選擇機制與目標變量相關(主動變量更常見)。
非選舉人(非選舉人):未選舉人有系統地不同。
幸存者(survivorship):忽略已離開/被阻止的人。
標簽偏差:嘈雜的標簽,代理快捷方式,「手動」調整。
Liki:使用未來的infa 形成樣本/fich。
4)樣本大小和功率
4.1接近
對於精度(e)和信任(1-\alpha):[
n \approx \frac{z_{\alpha/2}^2, p(1-p)}{e^2}
]
保守地采取(p=0{}5)。根據需要調整到最終人群。
對於已知平均值(\sigma):[
n \approx \left(\frac{z_{\alpha/2},\sigma}{e}\right)^2
]
4.2設計效果和有效尺寸
設計效果:(\mathrm {Deff}=1+(m-1)\rho),其中(m)為群集大小,(\rho)為群集內相關性。
有效尺寸:(n_\text{eff}=n/\mathrm{Deff})。集群/加權設計通常需要更多(n)。
4.3 A/B和MDE
對於對稱組中的二元度量:[
n_{\text{на группу}} \approx \frac{2(z_{1-\alpha/2}+z_{1-\beta})^2, \bar{p}(1-\bar{p})}{\mathrm{MDE}^2}
]
其中(\bar {p}為基線,MDE為檢測效果最小。
考慮季節性和幹擾(spillover),應用CUPED/協變量來減少色散。
5)重量和校準(使樣本「看起來像」人口)
設計權重:(w_i=1/\pi_i)(選擇概率的倒數)。
後分層和滾動:我們將加權邊際(國家/平臺/性別年齡等)適合已知份額。
校準(calibration weighting):與控制總量精確匹配時,最大限度地減少權重偏差。
Butstrap/復制:正確估計權重下的方差。
診斷:ESS(有效樣本大小),重量散布(CV,p95/p5),按關鍵特征進行前/後比較。
6)班級和罕見事件
按目標分層的選擇:超標罕見,但在學習時總是使用閾值/權重調整。
成本感性學習:加權駝鹿代替合成物。
SMOTE/ADASYN:小心-泄漏/文物風險;保持嚴格的臨時/團體拆分。
估計:PR-AUC,Recall@FPR≤x%;概率校準。
7)流媒體和大數據
Reservoir采樣:從未知長度的流中保留代表性子集。
事件采集:與頻率/重要性成比例;對於罕見的觸發緩沖區。
計數器和草圖:用於頻率/唯一性的Bloom/Count-Min;對於分析-結合定期精確計數。
De-dup和等效性:事件鍵,重復數據消除窗口。
8)時間和空間方面
基於時間的采樣:固定窗口(滾動),點對點時間正確性。
集群/地理采樣:按節點/區域分組;考慮空間自相關。
季節性/節奏:每周/節假日的時間/天的代表性覆蓋。
9)非政策/博客數據和互惠性
10)代表性診斷
邊際比較:人口vs樣本表按關鍵特征。
協方差平衡:SMD(標準化男性difference),Love plots。
密度/分量:KS測試,quantile-plots,PSI。
模型證明:將度量穩定在超時和超域切片上。
ESS和權重:低ESS表示估計方差很高。
11)反模式
「Samplim昨天只活躍」→失去寒冷/睡眠。
平均百分比為「段平均值」,沒有權重。
在單個樣本中混合聚合級別(事件和用戶)。
隨機選擇依賴於靶標的過濾器(選擇出路)。
Cross-val在相關數據下沒有組/時間分裂。
在分解為train/val(泄漏)之前應用SMOTE。
12)私人腳本(案例)
玩家調查:國家/平臺/年齡分層;對MAU份額進行分層後;控制位移的非軌道。
EDA的日誌:系統1:N事件集合+罕見類型的完整覆蓋。
Fro-Detections:靶向分層,成本敏感麋鹿,PR-AUC得分和Recall@FPR≤x%。
受流量限制的A/B:MDE計算,電源規則擴展,CUPED。
非策略促銷評估:IPS/DR加權限制(trimming),驗證支持重叠。
13)工件模板
打包計劃(template)
目標/人口:- 抽樣框:來源,覆蓋/洞
- 選擇單位:用戶/會議/事件
- 設計:strats(鄉村,平臺),股份,選擇方式
- 尺寸(n):計算,假設(α,電力,MDE), Deff
- 重量方案:設計重量,後分層(控制總量)
- 日歷:日期/小時/假期的覆蓋範圍
- 質量:塗層測試,非塗層計劃,接觸程序
- 風險:育種,幹擾,隱私/PII
- 所有者和控制權:誰計數/儲存/轉售
稱重護照(模板)
基本權重: (w_i=1/\pi_i)
校準: 目標(國家,平臺,age),方法(raking),公差
限制: trimming w ∈ [w_min,w_max]
診斷: ESS、CV (w)、SMD前/後
用途: 哪些報告/模型應用權重
版本: v1→v2、日期、所有者
14)隱私和道德
Privacy by Design:最小化字段、聚合、別名化。
差分私有性:隨機化/子集合,以增強私有性(私有化)。
公平性:根據敏感屬性檢查錯誤/權重差異;不要允許群體的「隱形」。
15)發射前支票清單
- 樣本框架已描述;確定並記錄了塗層的「漏洞」
- 選擇設計(平流/集群),計算(n), Deff, MDE
- 調整設計權重和校準計劃(控制總量一致)
- 確定時間窗口/季節性;有一個計劃通過非response
- 驗證分割考慮時間/組;沒有泄漏
- 質量指標:ESS、SMD、PSI、bootstrap間隔
- 文件和版本;訪問權限和隱私路徑已驗證
迷你詞匯表
Deff:由於設計而增加估計方差的乘數。
ESS:加權後的有效樣本量。
IPS/DR:非策略/邏輯數據的加權方法。
SMD:標準化平均差值(協變量平衡)。
Reservoir采樣:從流中維持隨機采樣。
底線
代表性不是「有樣本的幸運」,而是設計過程:正確的框架,精心的選擇設計,足夠的尺寸,稱重和校準,誠實的拆分和嚴格的診斷。按照所描述的做法,您可以減少偏差,提高推理的可移植性,並為產品,營銷,風險和ML提供可靠的解決方案。