Logo GH

Самплирлеу және репрезентативтілік

Самплирлеу және репрезентативтілік

Самплирлеу - бұл өлшеулер, эксперименттер және модельдерді оқыту үшін бақылаулардың кіші жиынын таңдау. Репрезентативтілік іріктемеден алынған қорытындылар жүйелі қатесіз нысаналы популяцияға масштабталатынын білдіреді. Төменде - іріктемені қалай жобалау, оның сапасын бағалау және ығысуды түзету.

1) Базалық ұғымдар

Популяция: нысандар жиынтығы (барлық пайдаланушылар/сессиялар/транзакциялар).
Іріктеме шеңбері (sampling frame): нақты алынатын тізім/механизм (жабындар мен «тесіктерді» анықтау маңызды).
Таңдау бірлігі: пайдаланушы, сессия, оқиға, транзакция, құрылғы.
Репрезентативтілік: іріктеме мен популяциядағы негізгі белгілердің бөлінуінің сәйкес келуі (кездейсоқ қате жіберумен).
Кездейсоқ vs жүйелі қате: ығысуға қарсы бағалардың дисперсиясы (bias).

2) Сэмплирлеу түрлері

2. 1 Ықтималдық (артықшылығы бар)

SRS (жай кездейсоқ): іріктеудің тең ықтималдығы.
Стратификацияланған: популяцияны страталарға бөлу (ел/арна/платформа), содан кейін стратаның ішіндегі SRS → төмен дисперсия және жақсы жабу.
Кластерлік: топтарды іріктеу (күндер/серверлер/дүкендер); арзан, бірақ кластер ішіндегі корреляциядан жоғары.
Жүйелік: кездейсоқ басталғаннан кейін әрбір k-элементі («синхронды емес» деректер талап етіледі).
PPS (probability proportional to size): юнит мөлшері ∝ ықтималдық (мысалы, серіктес трафигінің көлемі).

2. 2 Мүмкін емес (сақтықпен)

Қолайлылық/еріктілер: жылдам сауалнамалар, «басатын» логтар → селекциялық ығысу қаупі.
Квоталық/қар үйіндісі: тауашалық топтарда пайдалы, бірақ келесі калибрлеу қажет.

3) Ығысу көздері

Жабындысы (coverage): таралымның бір бөлігі рамада жоқ (мысалы, трекингке тыйым салынған кезде iOS-деректер).
Селекция: іріктеу тетігі мақсатты айнымалымен байланысты (белсенділері жиі түседі).
Таңдалмаған (nonresponse): жауап бермегендер жүйелі түрде ерекшеленеді.
Тірі қалғандар (survivorship): кеткендерді/бұғатталғандарды елемеу.
Лейбл-ығысулар: шулы белгілер, прокси-жапсырмалар, «қолмен» түзетулер.
Ликтер: іріктемені қалыптастыру кезінде болашақ ақпаратты пайдалану.

4) Іріктеме мөлшері және қуаты

4. 1 Жақындаулар

Үлес үшін (p) (e) дәлдігімен және сеніммен (1-\alpha):
[
n \approx \frac{z_{\alpha/2}^2, p(1-p)}{e^2}
]

Консервативті түрде аламыз (p = 0 {.} 5). Қажет болған жағдайда соңғы популяцияға түзету енгізіңіз.

Белгілі орташасы үшін (\sigma):
[
n \approx \left(\frac{z_{\alpha/2},\sigma}{e}\right)^2
]

4. 2 Дизайн-әсері және тиімді өлшемі

Design Effect: (\mathrm {Deff} = 1 + (m-1 )\rho), мұнда (m) - кластер өлшемі, (\rho) - кластер ішіндегі корреляция.
Тиімді өлшемі: (n_\text{eff}=n/\mathrm{Deff}). Кластерлік/салмақталған дизайндар көбінесе көбірек (n) талап етеді.

4. 3 A/B және MDE

Симметриялық топтар кезіндегі бинарлық метрика үшін:
[
n_{\text{на группу}} \approx \frac{2(z_{1-\alpha/2}+z_{1-\beta})^2, \bar{p}(1-\bar{p})}{\mathrm{MDE}^2}
]

мұнда (\bar {p}) - негізгі деңгей, MDE - ең аз анықталатын әсер.
Маусымдылықты және интерференцияны (spillover) ескеріңіз, дисперсияны төмендету үшін CUPED/ковариаттарды қолданыңыз.

5) Салмақтар және калибрлеу (популяцияға «ұқсас» іріктемесін жасаймыз)

Дизайн-салмағы: (w_i=1/\pi_i) (іріктеудің кері ықтималдығы).
Пост-стратификация және raking: өлшенген маргиналдарды (ел/платформа/жынысы-жасы және т.б.) белгілі үлестерге бейімдейміз.
Калибрлеу (calibration weighting): бақылау тоталдарымен дәл сәйкес келген кезде таразылардың ауытқуын барынша азайтамыз.
Бутстрэп/репликация: таразы кезіндегі дисперсияны дұрыс бағалау.
Диагностика: ESS (effective sample size), таразылардың таралуы (CV, p95/p5), негізгі белгілері бойынша дейін/кейін салыстыру.

6) Сыныптардың имбалансы және сирек оқиғалар

Таргет бойынша стратификацияланған іріктеу: oversample сирек сыныбы, бірақ оқыту кезінде әрқашан табалдырықты/таразыны түзетуді пайдаланыңыз.
Cost-sensitive learning: синтетика орнына өлшенген лосстар.
SMOTE/ADASYN: абайлаңыз - ағып кету/артефактілер қатері; қатаң уақытша/топтық сплиттерді ұстаңыз.
Бағалау: PR-AUC, Recall @FPR ≤ x%; ықтималдықтарды калибрлеу.

7) Ағынды және үлкен деректер

Reservoir sampling: ұзындығы белгісіз ағыннан репрезентативті қосымша жинақты ұстап тұрыңыз.
Оқиғалар сэмплингі: жиілікке/маңыздылыққа пропорционалды; сирек кездесетіндер үшін - триггерлік буферлер.
Есептегіштер мен нобайлар: Жиіліктер/бірегейлік үшін Bloom/Count-Min; талдау үшін - мерзімді нақты есептеумен біріктіріңіз.
De-dup және теңсіздік: оқиғаның кілті, дедупликация терезесі.

8) Уақытша және кеңістіктік аспектілер

Time-based sampling: бекітілген терезелер (rolling), point-in-time дұрыстығы.
Cluster/geo-sampling: тораптар/өңірлер бойынша кластерлеу; кеңістіктегі автокорреляцияны ескеріңіз.
Маусымдылық/ырғақ: аптаның/күннің/мерекенің репрезентативті жабыны.

9) Off-policy/логикалық деректер және каузальдық

IPS (inverse propensity): (w_i=1/\pi(a_ix_i)) жаңа саясатқа лог-сэмплдарды түзету үшін.
DR-бағалар: Ауытқу мен дисперсияны төмендету үшін Doubly Robust.
Тасымалдануы: нәтижелерді нарықтар/арналар арасында тасымалдау - ковариаттың (covariate shift) сәйкестігін тексеріңіз.
Label shift: (P (y)) тұрақты (P (x)y)); EM/қайта калибрлеуді пайдаланыңыз.

10) Репрезентативтілікті диагностикалау

Маргиналдарды салыстыру: кесте популяциясы vs түйінді белгілері бойынша іріктеме.
Баланс ковариаты: SMD (standardized mean difference), Love plots.
Тығыздықтар/квантильдер: KS-тесттер, quantile-plots, PSI.
Үлгіні аттестаттау: метриктерді out-of-time және out-of-domain қималарында тұрақтандыру.
ESS және салмағы: төмен ESS бағалардың жоғары дисперсиясын білдіреді.

11) Қарсы үлгілер

«Сэмплим тек белсенді кеше» → суық/ұйықтайтын жоғалту.
Таразысыз «сегменттер бойынша орташа» пайыздарды орташаландыру.
Біріктіру деңгейлерін (оқиғалар мен пайдаланушылар) бір іріктемеде араластыру.
Таргетке байланысты сүзгілерден кейін кездейсоқ іріктеу (selection on the outcome).
Тәуелді деректер кезінде топтық/уақытша сплиттерсіз cross-val.
SMOTE-ді train/val (ағып кету) деп бөлгенге дейін қолдану.

12) Жеке сценарийлер (кейстер)

Ойыншылардан сұрау: ел/платформа/жас бойынша стратификация; MAU үлестеріне пост-стратификация; орын ауыстыруды бақылау.
EDA үшін логтар: оқиғалар сэмплін жүйелі 1:N + сирек кездесетін типтердің толық жабыны.
Фрод-детект: таргет-стратификация, cost-sensitive лосстер, PR-AUC және Recall бойынша бағалау @FPR ≤ x%.
A/B шектеулі трафигімен: MDE есептеу, power-ережелер бойынша ұзарту, CUPED.
Off-policy промо бағалау: IPS/DR шектелген салмақ (trimming), қолдаулардың жабылуын тексеру.

13) Артефактілердің үлгілері

Құрастыру жоспары (template)

Мақсаты/таралымы:...

Таңдау шеңбері: көздер, жабындар/тесіктер

Іріктеу бірлігі: пайдаланушы/сессия/оқиға

Дизайн: страталар (country, platform), үлестер, іріктеу тәсілі

Өлшемі (n): есептеу, жорамалдар (α, power, MDE), Deff

Салмақ схемасы: дизайн-салмақ, пост-стратификация (бақылау тоталдары)

Күнтізбе: күндерді/сағаттарды/мерекелерді жабу

Сапасы: жабу тесттері, nonresponse-жоспар, байланыс процедуралары

Тәуекелдер: селекция, интерференция, privacy/PII

Иелері және бақылау: кім санайды/сақтайды/нұсқалайды

Өлшеу паспорты (template)

Негізгі салмақтар: (w_i=1/\pi_i)

Калибрлеу: мақсаттар (country, platform, age), әдіс (raking), рұқсаттар

Шектеулер: trimming w ∈ [w_min, w_max]

Диагностика: ESS, CV (w), SMD дейін/кейін

Пайдалану: қандай есептер/модельдер салмақты қолданады

Нұсқалары: v1 → v2, күні, иелері

14) Құпиялылық және әдеп

Privacy by Design: өрістерді, агрегацияларды, псевдонимдеуді азайту.
Дифференциалды жекешелендіру: рандомизация/субсэмплирлеу жекешелікті күшейту ретінде (privacy amplification).
Әділдік: қателер/салмақ айырмашылығын сезімтал атрибуттар бойынша тексеріңіз; топтардың «көрінбеуіне» жол бермеңіз.

15) Іске қосар алдындағы чек-парақ

  • Іріктеме шеңбері сипатталған; жабынның «тесіктері» анықталды және құжатталды
  • Таңдалған дизайн (страталар/кластерлер), есептелген (n), Deff, MDE
  • Дизайн салмағы мен калибрлеу жоспары теңшелген (бақылау тоталдары келісілген)
  • Уақытша терезелер/маусымдық анықталған; nonresponse бойынша жоспар бар
  • Валидация сплиттері уақыт/топты ескереді; жылыстау жоқ
  • Сапа өлшемдері: ESS, SMD, PSI, бутстрэп аралықтары
  • Құжаттама және нұсқалар; рұқсаттар мен privacy-контурлар тексерілді

Шағын глоссарий

Deff: дизайнға байланысты бағалау дисперсиясын ұлғайтатын көбейткіш.
ESS: өлшеуден кейін іріктеменің тиімді мөлшері.
IPS/DR: off-policy/логикалық деректер үшін өлшеу әдістері.
SMD: орташа стандартталған айырма (ковариат балансы).
Reservoir sampling: кездейсоқ сэмплді ағыннан ұстап тұру.

Жиынтығы

Репрезентативтілік - бұл «сэмплмен сәттілік» емес, жобаланған процесс: дұрыс шеңбер, ойластырылған іріктеу дизайны, жеткілікті өлшем, өлшеу және калибрлеу, адал сплиттер және қатаң диагностика. Сипатталған тәжірибелерді қолдана отырып, сіз ауытқуды төмендетесіз, қорытындылардың төзімділігін арттырасыз және өнім, маркетинг, тәуекелдер және ML үшін сенімді шешімдер аласыз.

Contact

Бізбен байланысыңыз

Кез келген сұрақ немесе қолдау қажет болса, бізге жазыңыз.Біз әрдайым көмектесуге дайынбыз!

Telegram
@Gamble_GC
Интеграцияны бастау

Email — міндетті. Telegram немесе WhatsApp — қосымша.

Сіздің атыңыз міндетті емес
Email міндетті емес
Тақырып міндетті емес
Хабарлама міндетті емес
Telegram міндетті емес
@
Егер Telegram-ды көрсетсеңіз — Email-ге қоса, сол жерге де жауап береміз.
WhatsApp міндетті емес
Пішім: +ел коды және номер (мысалы, +7XXXXXXXXXX).

Батырманы басу арқылы деректерді өңдеуге келісім бересіз.