采样和代表性
采样和代表性
采样是用于测量,实验和模型训练的观测子集的选择。代表性意味着从样本中得出的结论在没有系统错误的情况下扩展到目标人群。下面-如何设计样本,评估其质量并调整位移。
1)基本概念
人口:目标对象集(所有用户/会话/事务)。
采样框架(采样框架):我们实际从中采样的列表/机制(重要的是要识别覆盖物和"漏洞")。
选择单位:用户、会话、事件、事务、设备。
代表性:样本和人群中关键特征分布的匹配(具有随机误差可及性)。
随机vs系统错误:估计值与位移的方差(bias)。
2)采样类型
2.1概率(首选)
SRS(简单随机):相等选择概率。
分层:将人口分成平流(国家/频道/平台),然后在平流层内进行SRS →低于方差,覆盖范围更好。
群集:群组选择(天/服务器/商店);价格便宜,但高于集群内相关性。
系统性:随机启动后的每个k元素(需要"非同步"数据)。
PPS(可扩展大小)-∝ unit大小的概率(例如合作伙伴流量量)。
2.2不可思议(谨慎)
设施/志愿者:快速调查,"点击"的日志→选择偏见的风险。
配额/雪球:在利基群体中有用,但需要后续校准。
3)位移源
覆盖(coverage):框架中缺少部分人口(例如,禁止跟踪时的iOS数据)。
选择:选择机制与目标变量相关(主动变量更常见)。
非选举人(非选举人):未选举人有系统地不同。
幸存者(survivorship):忽略已离开/被阻止的人。
标签偏差:嘈杂的标签,代理快捷方式,"手动"调整。
Liki:使用未来的infa 形成样本/fich。
4)样本大小和功率
4.1接近
对于精度(e)和信任(1-\alpha):[
n \approx \frac{z_{\alpha/2}^2, p(1-p)}{e^2}
]
保守地采取(p=0{}5)。根据需要调整到最终人群。
对于已知平均值(\sigma):[
n \approx \left(\frac{z_{\alpha/2},\sigma}{e}\right)^2
]
4.2设计效果和有效尺寸
设计效果:(\mathrm {Deff}=1+(m-1)\rho),其中(m)为群集大小,(\rho)为群集内相关性。
有效尺寸:(n_\text{eff}=n/\mathrm{Deff})。集群/加权设计通常需要更多(n)。
4.3 A/B和MDE
对于对称组中的二元度量:[
n_{\text{на группу}} \approx \frac{2(z_{1-\alpha/2}+z_{1-\beta})^2, \bar{p}(1-\bar{p})}{\mathrm{MDE}^2}
]
其中(\bar {p}为基线,MDE为检测效果最小。
考虑季节性和干扰(spillover),应用CUPED/协变量来减少色散。
5)重量和校准(使样本"看起来像"人口)
设计权重:(w_i=1/\pi_i)(选择概率的倒数)。
后分层和滚动:我们将加权边际(国家/平台/性别年龄等)适合已知份额。
校准(calibration weighting):与控制总量精确匹配时,最大限度地减少权重偏差。
Butstrap/复制:正确估计权重下的方差。
诊断:ESS(有效样本大小),重量散布(CV,p95/p5),按关键特征进行前/后比较。
6)班级和罕见事件
按目标分层的选择:超标罕见,但在学习时总是使用阈值/权重调整。
成本感性学习:加权驼鹿代替合成物。
SMOTE/ADASYN:小心-泄漏/文物风险;保持严格的临时/团体拆分。
估计:PR-AUC,Recall@FPR≤x%;概率校准。
7)流媒体和大数据
Reservoir采样:从未知长度的流中保留代表性子集。
事件采集:与频率/重要性成比例;对于罕见的触发缓冲区。
计数器和草图:用于频率/唯一性的Bloom/Count-Min;对于分析-结合定期精确计数。
De-dup和等效性:事件键,重复数据消除窗口。
8)时间和空间方面
基于时间的采样:固定窗口(滚动),点对点时间正确性。
集群/地理采样:按节点/区域分组;考虑空间自相关。
季节性/节奏:每周/节假日的时间/天的代表性覆盖。
9)非政策/博客数据和互惠性
10)代表性诊断
边际比较:人口vs样本表按关键特征。
协方差平衡:SMD(标准化男性difference),Love plots。
密度/分量:KS测试,quantile-plots,PSI。
模型证明:将度量稳定在超时和超域切片上。
ESS和权重:低ESS表示估计方差很高。
11)反模式
"Samplim昨天只活跃"→失去寒冷/睡眠。
平均百分比为"段平均值",没有权重。
在单个样本中溷合聚合级别(事件和用户)。
随机选择依赖于靶标的过滤器(选择出路)。
Cross-val在相关数据下没有组/时间分裂。
在分解为train/val(泄漏)之前应用SMOTE。
12)私人脚本(桉例)
玩家调查:国家/平台/年龄分层;对MAU份额进行分层后;控制位移的非轨道。
EDA的日志:系统1:N事件集合+罕见类型的完整覆盖。
Fro-Detections:靶向分层,成本敏感麋鹿,PR-AUC得分和Recall@FPR≤x%。
受流量限制的A/B:MDE计算,电源规则扩展,CUPED。
非策略促销评估:IPS/DR加权限制(trimming),验证支持重迭。
13)工件模板
打包计划(template)
目标/人口:- 抽样框:来源,覆盖/洞
- 选择单位:用户/会议/事件
- 设计:strats(乡村,平台),股份,选择方式
- 尺寸(n):计算,假设(α,电力,MDE), Deff
- 重量方桉:设计重量,后分层(控制总量)
- 日历:日期/小时/假期的覆盖范围
- 质量:涂层测试,非涂层计划,接触程序
- 风险:育种,干扰,隐私/PII
- 所有者和控制权:谁计数/储存/转售
称重护照(模板)
基本权重: (w_i=1/\pi_i)
校准: 目标(国家,平台,age),方法(raking),公差
限制: trimming w ∈ [w_min,w_max]
诊断: ESS、CV (w)、SMD前/后
用途: 哪些报告/模型应用权重
版本: v1→v2、日期、所有者
14)隐私和道德
Privacy by Design:最小化字段、聚合、别名化。
差分私有性:随机化/子集合,以增强私有性(私有化)。
公平性:根据敏感属性检查错误/权重差异;不要允许群体的"隐形"。
15)发射前支票清单
- 样本框架已描述;确定并记录了涂层的"漏洞"
- 选择设计(平流/集群),计算(n), Deff, MDE
- 调整设计权重和校准计划(控制总量一致)
- 确定时间窗口/季节性;有一个计划通过非response
- 验证分割考虑时间/组;没有泄漏
- 质量指标:ESS、SMD、PSI、bootstrap间隔
- 文件和版本;访问权限和隐私路径已验证
迷你词汇表
Deff:由于设计而增加估计方差的乘数。
ESS:加权后的有效样本量。
IPS/DR:非策略/逻辑数据的加权方法。
SMD:标准化平均差值(协变量平衡)。
Reservoir采样:从流中维持随机采样。
底线
代表性不是"有样本的幸运",而是设计过程:正确的框架,精心的选择设计,足够的尺寸,称重和校准,诚实的拆分和严格的诊断。按照所描述的做法,您可以减少偏差,提高推理的可移植性,并为产品,营销,风险和ML提供可靠的解决方案。