Logo GH

Örnekleme ve temsiliyet

Örnekleme ve temsiliyet

Örnekleme, ölçümler, deneyler ve model eğitimi için bir gözlem alt kümesinin seçimidir. Temsiliyet, örneklemden elde edilen sonuçların önyargı olmadan hedef nüfusa ölçeklendirilmesi anlamına gelir. Aşağıda bir numunenin nasıl tasarlanacağı, kalitesinin nasıl değerlendirileceği ve doğru ofsetler bulunmaktadır.

1) Temel kavramlar

Popülasyon: Hedef nesne kümesi (tüm kullanıcılar/oturumlar/işlemler).
Örnekleme çerçevesi: Aslında seçtiğimiz liste/mekanizma (kaplamaları ve "delikleri" tanımlamak önemlidir).
Seçim birimi: kullanıcı, oturum, olay, işlem, cihaz.
Temsiliyet: örneklem ve popülasyondaki anahtar özellik dağılımlarını eşleştirme (rastgele hata toleransı ile).
Rastgele vs önyargı: tahminlerin varyansı karşı önyargı (önyargı).

2) Örnekleme türleri

2. 1 Olasılıksal (tercih edilen)

SRS (basit rastgele): Eşit seçim olasılığı.
Tabakalı: tabakalı nüfus (ülke/kanal/platform), daha sonra katmanlar içinde SRS - daha düşük varyans ve daha iyi kapsama alanı.
Küme: grupların seçimi (günler/sunucular/mağazalar); Ucuz ama daha yüksek intrakluster korelasyon.
Sistematik: Rastgele bir başlangıçtan sonra her kth elemanı ("asenkron" veri gereklidir).
PPS (boyut ile orantılı olasılık) - olasılık ∝ birim boyutu (örneğin, ortak trafik hacmi).

2. 2 İnanılmaz (dikkatle)

Olanaklar/gönüllüler: hızlı anketler, "tıklama" günlükleri - seçim önyargı riski.
Kota/kartopu: niş gruplarında yararlıdır, ancak sonraki kalibrasyon gereklidir.

3) Yer değiştirme kaynakları

Kapsam: Nüfusun bir kısmı çerçevede değil (örneğin, izleme yasak olduğunda iOS verileri).
Seçim: seçim mekanizması hedef değişken ile ilişkilidir (aktif daha sık düşer).
Yanıt vermeme: Yanıt vermeyenler sistematik olarak farklıdır.
Survivors: Ayrılan/engellenen yok sayma.
Ofset etiketi: gürültülü etiketler, proxy etiketleri, "manuel" ayarlamalar.
Yüzler: örnek/özelliğin oluşumunda gelecekteki bilgilerin kullanımı.

4) Örnek boyutu ve gücü

4. 1 Yaklaşımlar

Hassas (e) ve güvenli (1-\alpha) kesir (p) için:
[
n\yaklaşık\frac {z _ {\alpha/2} ^ 2, p (1-p)} {e ^ 2}
]

Konservatif olarak alıyoruz (p = 0 {.} 5). Gerekirse son nüfusa göre ayarlayın.

Bilinen (\sigma) ile ortam için:
[
n\yaklaşık\sol (\frac {z _ {\alpha/2} ,\sigma} {e }\sağ) ^ 2
]

4. 2 Tasarım etkisi ve etkili boyut

Tasarım Etkisi: (\mathrm {Deff} = 1 + (m-1 )\rho), burada (m) küme boyutudur, (\rho) küme içi korelasyondur.
Etkili boyut: (n_\text{eff}=n/\mathrm{Deff}). Küme/ağırlıklı tasarımlar genellikle daha fazla (n) gerektirir.

4. 3 A/B ve MDE

Simetrik gruplarla bir ikili metrik için:
[
n_{\text{на группу} }\yaklaşık\frac {2 (z_{1-\alpha/2}+z_{1-\beta}) ^ 2 ,\bar {p} (1-\bar {p})} {\mathrm {MDE} ^ 2}
]

Burada (\bar {p}) temel seviyedir, MDE en az tespit edilebilir etkidir.
Mevsimsellik ve parazit (yayılma) düşünün, varyansı azaltmak için CUPED/kovaryatlar uygulayın.

5) Ağırlıklar ve kalibrasyon (popülasyona "benzer" örnekliyoruz)

Tasarım ağırlıkları: (w_i=1/\pi_i) (seçimin ters olasılığı).
Tabakalaşma sonrası ve tırmıklama: Ağırlıklı marjinali (ülke/platform/cinsiyet-yaş vb.) Bilinen fraksiyonlara göre ayarlarız.
Kalibrasyon ağırlığı: Tam olarak kontrol toplamlarıyla çakışırken ağırlıkların sapmasını en aza indirin.
Bootstrap/replikasyon: Ağırlıklardaki varyansların doğru tahmini.
Teşhis: ESS (etkili örneklem büyüklüğü), ağırlık yayılımı (CV, p95/p5), temel özelliklerle karşılaştırmadan önce/sonra.

6) Sınıf dengesizliği ve nadir olaylar

Hedefe göre tabakalı seçim: oversample nadir bir sınıftır, ancak her zaman eğitimde eşik/ağırlık ayarını kullanın.
Maliyete duyarlı öğrenme: sentetik yerine ağırlıklı kayıplar.
SMOTE/ADASYN: dikkat - sızıntı/eser riski; Sıkı zaman/grup bölünmeleri tutun.
Değerlendirme: PR-AUC, % Recall@FPR≤x; olasılık kalibrasyonu.

7) Akış ve Büyük Veri

Rezervuar örneklemesi: Bilinmeyen uzunluktaki bir akıştan temsili bir alt küme tutun.
Olay örneklemesi: frekans/önem ile orantılı; nadir - tetik tamponları için.
Sayaçlar ve eskizler: Frekanslar/benzersizlik için Bloom/Count-Min; Analitik için - periyodik doğru sayım ile birleştirin.
De-dup ve idempotency - olay anahtarları, veri tekilleştirme pencereleri.

8) Zamansal ve mekansal yönler

Zamana dayalı örnekleme: sabit pencereler (yuvarlanma), zaman içinde doğruluk.
Küme/coğrafi örnekleme: düğüm/bölgeye göre kümeleme; uzaysal otokorelasyonu düşünün.
Mevsimsellik/ritim: haftanın/tatillerin saatlerinin/günlerinin temsili kapsamı.

9) Politika dışı/günlük verileri ve nedensellik

IPS (ters eğilim): (w_i=1/\pi (a_ix_i)) yeni politika için günlük örneklerini düzeltmek için.
DR puanları: Önyargı ve varyansı azaltmak için İki Kat Sağlam.
Taşınabilirlik - Sonuçları pazarlar/kanallar arasında aktarın - Kovaryat kaymasını kontrol edin
Etiket kayması: (P (y)) stabil olarak değişir (P (x)y); EM/yeniden kalibrasyon kullanın.

10) Temsili teşhis

Marjinal karşılaştırma: tablolar popülasyon vs anahtar özelliklerine göre örnek.
Kovaryatörlerin dengesi: SMD (standartlaştırılmış ortalama fark), Aşk arsaları.
Yoğunluklar/nicelikler: KS testleri, nicel-grafikler, PSI.
Model kalifikasyonu: Zaman dışı ve alan dışı dilimlerdeki metriklerin stabilizasyonu.
ESS ve ağırlıklar: Düşük ESS, puanlarda yüksek varyansı işaret eder.

11) Anti-desenler

"Sample only active yesterday" - soğuk/uyuyanların kaybı.
Ağırlıklar olmadan ortalama yüzdeler "segment ortalaması".
Toplama düzeylerini (olaylar ve kullanıcılar) tek bir örnekte karıştırın.
Hedefe bağlı filtrelerden sonra rastgele seçim (sonuca göre seçim).
Bağımlı verilerle grup/zaman ayrımı olmadan çapraz val.
Tren/val (sızıntı) öncesi SMOTE uygulayın.

12) Özel senaryolar (durumlar)

Oyuncu anketi: Ülkeye/platforma/yaşa göre katmanlaştırılmış; MAU hisselerine tabakalaşma sonrası; Yanıtsız ofset kontrolü.
EDA için günlükler: sistematik 1:N olay örneği + nadir türlerin tam kapsamı.
Dolandırıcılık tespiti: hedef tabakalaşma, maliyete duyarlı kayıp, PR-AUC puanı ve % Recall@FPR≤x.
Kısıtlı trafik ile A/B: MDE hesaplama, güç kuralı yenileme, CUPED.
Politika dışı değerlendirme promosyonu: Ağırlık sınırlaması (düzeltme) ile IPS/DR, destek örtüşme kontrolü.

13) Eser desenleri

Örnekleme planı (şablon)

Hedef/Nüfus:...

Örnekleme kutusu: kaynaklar, kapaklar/delikler

Seçim birimi: kullanıcı/oturum/olay

Tasarım: katmanlar (ülke, platform), paylaşımlar, seçim yöntemi

Boyut (n): hesaplamalar, varsayımlar (α, güç, MDE), Deff

Ağırlık şeması: tasarım ağırlıkları, tabakalaşma sonrası (kontrol toplamları)

Takvim: gün/saat/tatil kapsamı

Kalite: kapsama testleri, yanıtsız plan, iletişim prosedürleri

Riskler: seçim, girişim, gizlilik/PII

Sahipler ve kontrol: kim sayar/depolar/sürümler

Tartı pasaportu (şablon)

Temel ağırlıklar: (w_i=1/\pi_i)

Kalibrasyon: hedefler (ülke, platform, yaş), yöntem (tırmıklama), toleranslar

Kısıtlamalar: w ∈ kırpma [w_min, w_max]

Teşhis: ESS, CV (w), SMD öncesi/sonrası

Kullanım: hangi raporların/modellerin ağırlık uyguladığı

Sürümler: V1 - v2, tarih, sahipler

14) Gizlilik ve etik

Tasarımla Gizlilik: alan küçültme, toplama, takma ad verme.
Diferansiyel gizlilik: Gizlilik amplifikasyonu olarak randomizasyon/alt örnekleme.
Adalet: Hassas özelliklere karşı hata/ağırlık farkını kontrol edin; Grupların "görünmez" olmasına izin vermeyin.

15) Başlangıç öncesi kontrol listesi

  • Örnekleme kutusu açıklanmıştır; Tanımlanan ve belgelenen kaplama delikleri
  • Seçilen tasarım (katmanlar/kümeler), hesaplanan (n), Def, MDE
  • Tasarım ağırlıklarını ve kalibrasyon planını ayarlayın (kontrol toplamları kabul edildi)
  • Zaman pencereleri/mevsimsellik tanımlı; Yanıt vermeyerek bir plan var
  • Doğrulama bölünmeleri zaman/grupları dikkate alır; Sızıntı yok
  • Kalite metrikleri: ESS, SMD, PSI, önyükleme aralıkları
  • Belgeler ve versiyonlar; Erişim hakları ve gizlilik hatları kontrol edildi

Mini Sözlük

Deff: çarpanın tasarımdan dolayı puanların varyansını arttırması.
ESS: ağırlıklandırmadan sonra etkili örneklem büyüklüğü.
IPS/DR: Politika dışı/günlük verileri için ağırlıklandırma yöntemleri.
SMD: Standartlaştırılmış ortalama fark (kovariat dengesi).
Rezervuar örneklemesi: akıştan rastgele bir örnek tutmak.

Toplam

Temsiliyet "örnekle şanslı'değil, tasarlanmış bir süreçtir: doğru bir çerçeve, düşünceli seçim tasarımı, yeterli boyut, tartım ve kalibrasyon, dürüst bölünmeler ve titiz teşhis. Açıklanan uygulamaları izleyerek, önyargıyı azaltır, sonuçların taşınabilirliğini arttırır ve ürün, pazarlama, risk ve ML için güvenilir çözümler elde edersiniz.

Contact

Bizimle iletişime geçin

Her türlü soru veya destek için bize ulaşın.Size yardımcı olmaya her zaman hazırız!

Telegram
@Gamble_GC
Entegrasyona başla

Email — zorunlu. Telegram veya WhatsApp — isteğe bağlı.

Adınız zorunlu değil
Email zorunlu değil
Konu zorunlu değil
Mesaj zorunlu değil
Telegram zorunlu değil
@
Telegram belirtirseniz, Email’e ek olarak oradan da yanıt veririz.
WhatsApp zorunlu değil
Format: +ülke kodu ve numara (örneğin, +90XXXXXXXXX).

Butona tıklayarak veri işlemenize onay vermiş olursunuz.