Örnekleme ve temsiliyet
Örnekleme ve temsiliyet
Örnekleme, ölçümler, deneyler ve model eğitimi için bir gözlem alt kümesinin seçimidir. Temsiliyet, örneklemden elde edilen sonuçların önyargı olmadan hedef nüfusa ölçeklendirilmesi anlamına gelir. Aşağıda bir numunenin nasıl tasarlanacağı, kalitesinin nasıl değerlendirileceği ve doğru ofsetler bulunmaktadır.
1) Temel kavramlar
Popülasyon: Hedef nesne kümesi (tüm kullanıcılar/oturumlar/işlemler).
Örnekleme çerçevesi: Aslında seçtiğimiz liste/mekanizma (kaplamaları ve "delikleri" tanımlamak önemlidir).
Seçim birimi: kullanıcı, oturum, olay, işlem, cihaz.
Temsiliyet: örneklem ve popülasyondaki anahtar özellik dağılımlarını eşleştirme (rastgele hata toleransı ile).
Rastgele vs önyargı: tahminlerin varyansı karşı önyargı (önyargı).
2) Örnekleme türleri
2. 1 Olasılıksal (tercih edilen)
SRS (basit rastgele): Eşit seçim olasılığı.
Tabakalı: tabakalı nüfus (ülke/kanal/platform), daha sonra katmanlar içinde SRS - daha düşük varyans ve daha iyi kapsama alanı.
Küme: grupların seçimi (günler/sunucular/mağazalar); Ucuz ama daha yüksek intrakluster korelasyon.
Sistematik: Rastgele bir başlangıçtan sonra her kth elemanı ("asenkron" veri gereklidir).
PPS (boyut ile orantılı olasılık) - olasılık ∝ birim boyutu (örneğin, ortak trafik hacmi).
2. 2 İnanılmaz (dikkatle)
Olanaklar/gönüllüler: hızlı anketler, "tıklama" günlükleri - seçim önyargı riski.
Kota/kartopu: niş gruplarında yararlıdır, ancak sonraki kalibrasyon gereklidir.
3) Yer değiştirme kaynakları
Kapsam: Nüfusun bir kısmı çerçevede değil (örneğin, izleme yasak olduğunda iOS verileri).
Seçim: seçim mekanizması hedef değişken ile ilişkilidir (aktif daha sık düşer).
Yanıt vermeme: Yanıt vermeyenler sistematik olarak farklıdır.
Survivors: Ayrılan/engellenen yok sayma.
Ofset etiketi: gürültülü etiketler, proxy etiketleri, "manuel" ayarlamalar.
Yüzler: örnek/özelliğin oluşumunda gelecekteki bilgilerin kullanımı.
4) Örnek boyutu ve gücü
4. 1 Yaklaşımlar
Hassas (e) ve güvenli (1-\alpha) kesir (p) için:[
n\yaklaşık\frac {z _ {\alpha/2} ^ 2, p (1-p)} {e ^ 2}
]
Konservatif olarak alıyoruz (p = 0 {.} 5). Gerekirse son nüfusa göre ayarlayın.
Bilinen (\sigma) ile ortam için:[
n\yaklaşık\sol (\frac {z _ {\alpha/2} ,\sigma} {e }\sağ) ^ 2
]
4. 2 Tasarım etkisi ve etkili boyut
Tasarım Etkisi: (\mathrm {Deff} = 1 + (m-1 )\rho), burada (m) küme boyutudur, (\rho) küme içi korelasyondur.
Etkili boyut: (n_\text{eff}=n/\mathrm{Deff}). Küme/ağırlıklı tasarımlar genellikle daha fazla (n) gerektirir.
4. 3 A/B ve MDE
Simetrik gruplarla bir ikili metrik için:[
n_{\text{на группу} }\yaklaşık\frac {2 (z_{1-\alpha/2}+z_{1-\beta}) ^ 2 ,\bar {p} (1-\bar {p})} {\mathrm {MDE} ^ 2}
]
Burada (\bar {p}) temel seviyedir, MDE en az tespit edilebilir etkidir.
Mevsimsellik ve parazit (yayılma) düşünün, varyansı azaltmak için CUPED/kovaryatlar uygulayın.
5) Ağırlıklar ve kalibrasyon (popülasyona "benzer" örnekliyoruz)
Tasarım ağırlıkları: (w_i=1/\pi_i) (seçimin ters olasılığı).
Tabakalaşma sonrası ve tırmıklama: Ağırlıklı marjinali (ülke/platform/cinsiyet-yaş vb.) Bilinen fraksiyonlara göre ayarlarız.
Kalibrasyon ağırlığı: Tam olarak kontrol toplamlarıyla çakışırken ağırlıkların sapmasını en aza indirin.
Bootstrap/replikasyon: Ağırlıklardaki varyansların doğru tahmini.
Teşhis: ESS (etkili örneklem büyüklüğü), ağırlık yayılımı (CV, p95/p5), temel özelliklerle karşılaştırmadan önce/sonra.
6) Sınıf dengesizliği ve nadir olaylar
Hedefe göre tabakalı seçim: oversample nadir bir sınıftır, ancak her zaman eğitimde eşik/ağırlık ayarını kullanın.
Maliyete duyarlı öğrenme: sentetik yerine ağırlıklı kayıplar.
SMOTE/ADASYN: dikkat - sızıntı/eser riski; Sıkı zaman/grup bölünmeleri tutun.
Değerlendirme: PR-AUC, % Recall@FPR≤x; olasılık kalibrasyonu.
7) Akış ve Büyük Veri
Rezervuar örneklemesi: Bilinmeyen uzunluktaki bir akıştan temsili bir alt küme tutun.
Olay örneklemesi: frekans/önem ile orantılı; nadir - tetik tamponları için.
Sayaçlar ve eskizler: Frekanslar/benzersizlik için Bloom/Count-Min; Analitik için - periyodik doğru sayım ile birleştirin.
De-dup ve idempotency - olay anahtarları, veri tekilleştirme pencereleri.
8) Zamansal ve mekansal yönler
Zamana dayalı örnekleme: sabit pencereler (yuvarlanma), zaman içinde doğruluk.
Küme/coğrafi örnekleme: düğüm/bölgeye göre kümeleme; uzaysal otokorelasyonu düşünün.
Mevsimsellik/ritim: haftanın/tatillerin saatlerinin/günlerinin temsili kapsamı.
9) Politika dışı/günlük verileri ve nedensellik
10) Temsili teşhis
Marjinal karşılaştırma: tablolar popülasyon vs anahtar özelliklerine göre örnek.
Kovaryatörlerin dengesi: SMD (standartlaştırılmış ortalama fark), Aşk arsaları.
Yoğunluklar/nicelikler: KS testleri, nicel-grafikler, PSI.
Model kalifikasyonu: Zaman dışı ve alan dışı dilimlerdeki metriklerin stabilizasyonu.
ESS ve ağırlıklar: Düşük ESS, puanlarda yüksek varyansı işaret eder.
11) Anti-desenler
"Sample only active yesterday" - soğuk/uyuyanların kaybı.
Ağırlıklar olmadan ortalama yüzdeler "segment ortalaması".
Toplama düzeylerini (olaylar ve kullanıcılar) tek bir örnekte karıştırın.
Hedefe bağlı filtrelerden sonra rastgele seçim (sonuca göre seçim).
Bağımlı verilerle grup/zaman ayrımı olmadan çapraz val.
Tren/val (sızıntı) öncesi SMOTE uygulayın.
12) Özel senaryolar (durumlar)
Oyuncu anketi: Ülkeye/platforma/yaşa göre katmanlaştırılmış; MAU hisselerine tabakalaşma sonrası; Yanıtsız ofset kontrolü.
EDA için günlükler: sistematik 1:N olay örneği + nadir türlerin tam kapsamı.
Dolandırıcılık tespiti: hedef tabakalaşma, maliyete duyarlı kayıp, PR-AUC puanı ve % Recall@FPR≤x.
Kısıtlı trafik ile A/B: MDE hesaplama, güç kuralı yenileme, CUPED.
Politika dışı değerlendirme promosyonu: Ağırlık sınırlaması (düzeltme) ile IPS/DR, destek örtüşme kontrolü.
13) Eser desenleri
Örnekleme planı (şablon)
Hedef/Nüfus:...
Örnekleme kutusu: kaynaklar, kapaklar/delikler
Seçim birimi: kullanıcı/oturum/olay
Tasarım: katmanlar (ülke, platform), paylaşımlar, seçim yöntemi
Boyut (n): hesaplamalar, varsayımlar (α, güç, MDE), Deff
Ağırlık şeması: tasarım ağırlıkları, tabakalaşma sonrası (kontrol toplamları)
Takvim: gün/saat/tatil kapsamı
Kalite: kapsama testleri, yanıtsız plan, iletişim prosedürleri
Riskler: seçim, girişim, gizlilik/PII
Sahipler ve kontrol: kim sayar/depolar/sürümler
Tartı pasaportu (şablon)
Temel ağırlıklar: (w_i=1/\pi_i)
Kalibrasyon: hedefler (ülke, platform, yaş), yöntem (tırmıklama), toleranslar
Kısıtlamalar: w ∈ kırpma [w_min, w_max]
Teşhis: ESS, CV (w), SMD öncesi/sonrası
Kullanım: hangi raporların/modellerin ağırlık uyguladığı
Sürümler: V1 - v2, tarih, sahipler
14) Gizlilik ve etik
Tasarımla Gizlilik: alan küçültme, toplama, takma ad verme.
Diferansiyel gizlilik: Gizlilik amplifikasyonu olarak randomizasyon/alt örnekleme.
Adalet: Hassas özelliklere karşı hata/ağırlık farkını kontrol edin; Grupların "görünmez" olmasına izin vermeyin.
15) Başlangıç öncesi kontrol listesi
- Örnekleme kutusu açıklanmıştır; Tanımlanan ve belgelenen kaplama delikleri
- Seçilen tasarım (katmanlar/kümeler), hesaplanan (n), Def, MDE
- Tasarım ağırlıklarını ve kalibrasyon planını ayarlayın (kontrol toplamları kabul edildi)
- Zaman pencereleri/mevsimsellik tanımlı; Yanıt vermeyerek bir plan var
- Doğrulama bölünmeleri zaman/grupları dikkate alır; Sızıntı yok
- Kalite metrikleri: ESS, SMD, PSI, önyükleme aralıkları
- Belgeler ve versiyonlar; Erişim hakları ve gizlilik hatları kontrol edildi
Mini Sözlük
Deff: çarpanın tasarımdan dolayı puanların varyansını arttırması.
ESS: ağırlıklandırmadan sonra etkili örneklem büyüklüğü.
IPS/DR: Politika dışı/günlük verileri için ağırlıklandırma yöntemleri.
SMD: Standartlaştırılmış ortalama fark (kovariat dengesi).
Rezervuar örneklemesi: akıştan rastgele bir örnek tutmak.
Toplam
Temsiliyet "örnekle şanslı'değil, tasarlanmış bir süreçtir: doğru bir çerçeve, düşünceli seçim tasarımı, yeterli boyut, tartım ve kalibrasyon, dürüst bölünmeler ve titiz teşhis. Açıklanan uygulamaları izleyerek, önyargıyı azaltır, sonuçların taşınabilirliğini arttırır ve ürün, pazarlama, risk ve ML için güvenilir çözümler elde edersiniz.