Pobieranie próbek i reprezentatywność
Pobieranie próbek i reprezentatywność
Pobieranie próbek to wybór podzbioru obserwacji do pomiarów, eksperymentów i szkolenia modelowego. Reprezentatywność oznacza, że wnioski z próby są skalowane do populacji docelowej bez uprzedzeń. Poniżej przedstawiono, jak zaprojektować próbkę, ocenić jej jakość i poprawne przesunięcia.
1) Podstawowe pojęcia
Populacja: docelowy zestaw obiektów (wszyscy użytkownicy/sesje/transakcje).
Rama próbkowania: lista/mechanizm, z którego faktycznie wybieramy (ważne jest, aby zidentyfikować powłoki i „otwory”).
Jednostka wyboru: użytkownik, sesja, wydarzenie, transakcja, urządzenie.
Reprezentatywność: dopasowanie rozkładu atrybutów kluczowych w próbce i populacji (z tolerancją błędów losowych).
Random vs bias: wariancja oszacowań w stosunku do stronniczości.
2) Rodzaje pobierania próbek
2. 1 Probabilistyka (preferowana)
SRS (prosty losowy): równe prawdopodobieństwo wyboru.
Stratyfikowany: stratyfikowana populacja (kraj/kanał/platforma), następnie SRS w warstwach → niższa wariancja i lepszy zasięg.
Klaster: wybór grup (dni/serwery/sklepy); tania, ale wyższa korelacja wewnątrzmaciczna.
Systematyczne: każdy element kth po losowym uruchomieniu (wymagane dane „asynchroniczne”).
PPS (prawdopodobieństwo proporcjonalne do wielkości) - prawdopodobieństwo ∝ wielkość jednostki (na przykład wielkość ruchu partnerskiego).
2. 2 Niesamowite (z ostrożnością)
Udogodnienia/wolontariusze: szybkie sondaże, „kliknięcie” dzienników → ryzyko selekcji.
Kwota/kula śnieżna: przydatna w grupach niszowych, ale potrzebna jest późniejsza kalibracja.
3) Źródła przemieszczenia
Zasięg: część populacji nie znajduje się w ramce (na przykład dane z systemu iOS podczas śledzenia są zabronione).
Wybór: mechanizm wyboru jest związany z zmienną docelową (aktywny częściej wypada).
Brak reakcji: Brak reakcji jest systematycznie inny.
Ocaleni: ignorowanie odchodzących/zablokowanych.
Etykieta offsetowa: hałaśliwe znaczniki, etykiety proxy, „ręczne” regulacje.
Twarze: wykorzystanie przyszłych informacji w tworzeniu próbki/funkcji.
4) Wielkość próbki i moc
4. 1 Przybliżenie
Dla frakcji p) z precyzją (e) i ufnością (1-\alpha):[
n\ok .\frac {z _ {\alpha/2} ^ 2, p (1-p)} {e ^ 2}
]
Bierzemy ostrożnie (p = 0 {.} 5). Dostosować w razie potrzeby do ostatecznej populacji.
Dla medium ze znanym (\sigma):[
n\approx\left (\frac {z _ {\alpha/2} ,\sigma} {e }\right) ^ 2
]
4. 2 Efekt projektowania i efektywny rozmiar
Efekt projektowania: (\mathrm {Deff} = 1 + (m-1 )\rho), gdzie (m) jest wielkością klastra, (\rho) jest korelacją wewnątrz klastra.
Efektywny rozmiar: (n_\text{eff}=n/\mathrm{Deff}). Projekty klastra/ważone często wymagają więcej (n).
4. 3 A/B i MDE
Dla metryki binarnej z grupami symetrycznymi:[
n_{\text{на мрука} }\ok\frac {2 (z_{1-\alpha/2}+z_{1-\beta}) ^ 2 ,\bar {p} (1-\bar {p})} {\mathrm {MDE} ^ 2}
]
gdzie (\bar {p}) jest poziomem bazowym, MDE jest minimalnie wykrywalnym efektem.
Należy rozważyć sezonowość i zakłócenia (spillover), zastosować CUPED/covariates w celu zmniejszenia wariancji.
5) Wagi i kalibracja (pobieramy próbki „podobne” do populacji)
Wagi konstrukcyjne: (w_i=1/\pi_i) (odwrotne prawdopodobieństwo wyboru).
Poststratyfikacja i grabież: dostosowujemy ważone marginesy (kraj/platforma/wiek płci itp.) do znanych frakcji.
Waga kalibracji: zminimalizować odchylenie ciężarów, gdy dokładnie pokrywa się z sumami kontrolnymi.
Bootstrap/replikacja: prawidłowe oszacowanie zmienności przy wadze.
Diagnostyka: ESS (efektywny rozmiar próbki), rozkład masy ciała (CV, p95/p5), przed/po porównaniu przez kluczowe cechy.
6) Nierównowaga klasowa i rzadkie zdarzenia
Stratyfikowany wybór według celu: oversample jest rzadką klasą, ale zawsze używać progu/wagi podczas treningu.
Uczenie się wrażliwe na koszty: ważone straty zamiast syntetyki.
SMOTE/ADASYN: ostrożność - ryzyko wycieków/artefaktów; zachować ścisły czas/podziały grupowe.
Ocena: PR-AUC, Recall @ FPR ≤ x%; kalibracja prawdopodobieństwa.
7) Streaming i Big Data
Pobieranie próbek zbiornika: Trzymać reprezentatywny podzbiór z strumienia o nieznanej długości.
Pobieranie próbek od zdarzeń: proporcjonalne do częstotliwości/znaczenia; dla rzadkich - bufory spustowe.
Liczniki i szkice: Bloom/Count-Min dla częstotliwości/wyjątkowości; dla analityki - łączyć z okresowym dokładnym liczeniem.
De-dup i idempotencja - klawisze zdarzeń, okna deduplikacji.
8) Aspekty czasowe i przestrzenne
Czasowe pobieranie próbek: stałe okna (walcowanie), poprawność punktu w czasie.
Gromadzenie/pobieranie próbek geograficznych: klastrowanie według węzła/regionu; rozważenie autokorrelacji przestrzennej.
Sezonowość/rytm: reprezentatywny zakres godzin/dni tygodnia/świąt.
9) Dane poza polityką/dziennik i przyczynowość
10) Diagnostyka reprezentatywności
Porównanie marginalne: tabele populacja vs próbka według kluczowych atrybutów.
Równowaga covariates: SMD (znormalizowana średnia różnica), Love plots.
Gęstości/kwantyle: badania KS, działki kwantylowe, PSI.
Kwalifikacja modelu: stabilizacja mierników na plasterkach pozakończonych i poza domeną.
ESS i wagi: Niskie sygnały ESS o dużej zmienności punktów.
11) Anty-wzory
„Próbka aktywna tylko wczoraj” → utrata zimna/podkłady.
Średnie wartości procentowe „średnia segmentowa” bez wagi.
Wymieszać poziomy agregacji (zdarzenia i użytkownicy) w jednej próbce.
Wybór losowy po filtrach zależnych od celu (wybór wyniku).
Cross-val bez podziału grupowego/czasowego z danymi zależnymi.
Stosować SMOTE przed pociągiem/val (wyciek).
12) Scenariusze prywatne (przypadki)
Badanie gracza: stratyfikowane według kraju/platformy/wieku; poststratyfikacja akcji MAU; brak kontroli offsetowej reakcji.
Dzienniki dla EDA: próbka zdarzeń systematycznych 1:N + pełne pokrycie rzadkich typów.
Wykrywanie oszustw: stratyfikacja docelowa, strata wrażliwa na koszty, wynik PR-AUC i Recall @ FPR ≤ x%.
A/B z ograniczonym ruchem: obliczenia MDE, odnawianie reguł zasilania, CUPED.
Promocja oceny poza polityką: IPS/DR z ograniczeniem wagi (przycinanie), sprawdzenie nakładania się wsparcia.
13) Wzory artefaktów
Plan pobierania próbek (szablon)
Cel/Populacja:...
Pole do pobierania próbek: źródła, pokrywy/otwory
Jednostka wyboru: użytkownik/sesja/wydarzenie
Projekt: warstwy (kraj, platforma), akcje, metoda selekcji
Wielkość (n): obliczenia, założenia (α, moc, MDE), Deff
Schemat wagowy: wagi konstrukcyjne, poststratyfikacja (łączne wartości kontrolne)
Kalendarz: dzień/godzina/wakacje
Jakość: testy zasięgu, plan braku reakcji, procedury kontaktowe
Ryzyko: wybór, ingerencja, prywatność/PII
Właściciele i kontrola: kto liczy/sklepy/wersje
Ważenie paszportu (szablon)
Waga podstawowa: (w_i=1/\pi_i)
Kalibracja: cele (kraj, platforma, wiek), metoda (grabienie), tolerancje
Ograniczenia: przycinanie w, [w_min, w_max]
Diagnostyka: ESS, CV (w), SMD przed/po
Zastosowanie: które raporty/modele stosują wagi
Wersje: v1 → v2, data, właściciele
14) Prywatność i etyka
Prywatność według projektu: minimalizacja pola, agregacja, pseudonimizacja.
Prywatność różnicowa: randomizacja/subskrypcja jako wzmacnianie prywatności.
Uczciwość: Sprawdź błąd/różnicę wagi przed wrażliwymi atrybutami; nie pozwalają grupom być „niewidzialne”.
15) Lista kontrolna przed startem
- Opisano pole do pobierania próbek; zidentyfikowane i udokumentowane otwory powłoki
- Wybrana konstrukcja (warstwy/klastry), obliczona (n), Deff, MDE
- Opracowanie projektu wagi i planu kalibracji (uzgodnione sumy kontrolne)
- Zdefiniowane okna czasowe/sezonowość; istnieje plan przez brak reakcji
- Podziały walidacyjne uwzględniają czas/grupy; brak przecieków
- Wskaźniki jakości: ESS, SMD, PSI, przedziały bootstrap
- Dokumentacja i wersje; sprawdzone prawa dostępu i kontury prywatności
Mini Glosariusz
Deff: mnożnik zwiększający zmienność punktów ze względu na konstrukcję.
ESS: efektywny rozmiar próbki po ważeniu.
IPS/DR: metody ważenia danych poza polityką/dziennikiem.
SMD: znormalizowana średnia różnica (równowaga covariate).
Pobieranie próbek zbiornika: utrzymanie próbki losowej ze strumienia.
Razem
Reprezentatywność nie jest „szczęśliwa z próbką”, ale zaprojektowany proces: prawidłowa ramka, przemyślany projekt selekcji, wystarczający rozmiar, ważenie i kalibracja, uczciwe podziały i rygorystyczna diagnoza. Stosując opisane praktyki, zmniejszasz stronniczość, zwiększasz przenośność wniosków i uzyskujesz niezawodne rozwiązania dla produktu, marketingu, ryzyka i ML.