نمونه برداری و نمایندگی
نمونه برداری و نمایندگی
نمونه برداری انتخاب یک زیر مجموعه از مشاهدات برای اندازه گیری ها، آزمایش ها و آموزش مدل است. نمایندگی به این معنی است که نتیجه گیری از نمونه به جمعیت هدف بدون تعصب مقیاس می شود. در زیر نحوه طراحی یک نمونه، ارزیابی کیفیت آن و جبران صحیح است.
1) مفاهیم اساسی
جمعیت: مجموعه ای از اشیاء هدف (همه کاربران/جلسات/معاملات).
قاب نمونه برداری: لیست/مکانیسم که از آن ما در واقع انتخاب (مهم است که برای شناسایی پوشش و «سوراخ»).
واحد انتخاب: کاربر، جلسه، رویداد، معامله، دستگاه.
نمایندگی: تطبیق توزیع ویژگی های کلیدی در نمونه و جمعیت (با تحمل خطای تصادفی).
تصادفی در مقابل تعصب: واریانس برآوردها در مقابل تعصب (تعصب).
2) انواع نمونه گیری
2. 1 احتمالی (ترجیح داده شده)
SRS (تصادفی ساده): احتمال انتخاب برابر است.
طبقه بندی شده: جمعیت طبقه بندی شده (کشور/کانال/پلت فرم)، سپس SRS در لایه ها → واریانس پایین تر و پوشش بهتر.
خوشه: انتخاب گروه ها (روزها/سرورها/فروشگاه ها) ؛ ارزان اما همبستگی درون خوشه ای بالاتر.
سیستماتیک: هر عنصر kth پس از شروع تصادفی (داده های «آسنکرون» مورد نیاز).
PPS (احتمال متناسب با اندازه) - احتمال ∝ اندازه واحد (به عنوان مثال، حجم ترافیک شریک).
2. 2 باور نکردنی (با احتیاط)
امکانات/داوطلبان: نظرسنجی سریع، «کلیک کردن» سیاهههای مربوط → خطر تعصب انتخاب.
سهمیه/گلوله برفی: در گروه های طاقچه مفید است، اما کالیبراسیون بعدی لازم است.
3) منابع جابجایی
پوشش: بخشی از جمعیت در قاب نیست (به عنوان مثال، داده های iOS هنگام ردیابی ممنوع است).
انتخاب: مکانیسم انتخاب با متغیر هدف همراه است (فعال تر اغلب سقوط می کند).
عدم پاسخ: بی پاسخ ها به طور سیستماتیک متفاوت هستند.
بازماندگان: نادیده گرفتن رفتگان/مسدود شده.
برچسب افست: برچسب های پر سر و صدا، برچسب های پروکسی، تنظیمات «دستی».
چهره ها: استفاده از اطلاعات آینده در شکل گیری نمونه/ویژگی.
4) اندازه نمونه و قدرت
4. 1 تقریب ها
برای کسر (p) با دقت (e) و اطمینان (1-\alpha):[
n\approximate\frac {z _ {\alpha/2} ^ 2, p (1-p)} {e ^ 2}
]
ما محافظه کارانه می گیریم (p = 0 {.} 5). در صورت لزوم جمعیت نهایی را تنظیم کنید.
برای متوسط با شناخته شده (\sigma):[
n\approximate\left (\frac {z _ {\alpha/2} ,\sigma} {e }\right) ^ 2
]
4. 2 اثر طراحی و اندازه موثر
اثر طراحی: (\mathrm {Deff} = 1 + (m-1 )\rho)، جایی که (m) اندازه خوشه است، (\rho) همبستگی درون خوشه ای است.
اندازه موثر: (n_\text{eff}=n/\mathrm{Deff}). طرح های خوشه ای/وزنی اغلب نیاز به تعداد بیشتری (n) دارند.
4. 3 A/B و MDE
برای یک متریک دودویی با گروههای متقارن:[
n_{\text{на группу }\تقریبا\frac {2 (z_{1-\alpha/2}+z_{1-\beta}) ^ 2 ,\bar {p} (1-\bar {p})} {\mathrm {MDE} ^ 2}
]
که در آن (\bar {p}) سطح پایه است، MDE اثر حداقل قابل تشخیص است.
فصلی و تداخل (سرریز) را در نظر بگیرید، CUPED/covariates را برای کاهش واریانس اعمال کنید.
5) وزن و کالیبراسیون (ما نمونه «مشابه» را به جمعیت)
وزن طراحی: (w_i=1/\pi_i) (احتمال معکوس انتخاب).
پس از طبقه بندی و جمع آوری: ما حاشیه وزن (کشور/پلت فرم/جنسیت سن، و غیره) را به بخش های شناخته شده تنظیم می کنیم.
وزن کالیبراسیون: به حداقل رساندن انحراف از وزن زمانی که دقیقا همزمان با مجموع کنترل.
بوت استرپ/تکرار: برآورد صحیح واریانس در وزن.
تشخیص: ESS (اندازه نمونه موثر)، گسترش وزن (CV، p95/p5)، قبل/بعد از مقایسه با ویژگی های کلیدی.
6) عدم تعادل کلاس و حوادث نادر
انتخاب طبقه بندی شده توسط هدف: oversample یک کلاس نادر است، اما همیشه از تنظیم آستانه/وزن در آموزش استفاده کنید.
یادگیری حساس به هزینه: از دست دادن وزن به جای مصنوعی.
SMOTE/ADASYN: احتیاط - خطر نشت/مصنوعات ؛ زمان دقیق/تقسیم گروه را نگه دارید.
رتبه: PR-AUC، Recall@FPR≤x٪ ؛ کالیبراسیون احتمال.
7) جریان و داده های بزرگ
نمونه برداری از مخزن: یک زیر مجموعه نماینده را از یک جریان با طول ناشناخته نگه دارید.
نمونه برداری رویداد: متناسب با فرکانس/اهمیت ؛ برای نادر - بافر ماشه.
شمارنده و طرح: بلوم/تعداد مین برای فرکانس/منحصر به فرد ؛ برای تجزیه و تحلیل - ترکیب با شمارش دقیق دوره ای.
De-dup و idempotency - کلید های رویداد، پنجره های deduplication.
8) جنبه های زمانی و فضایی
نمونه برداری مبتنی بر زمان: پنجره های ثابت (نورد)، نقطه در زمان صحت.
خوشه/جغرافیایی نمونه برداری: خوشه بندی توسط گره/منطقه ؛ خود همبستگی فضایی را در نظر بگیرید.
فصلی/ریتم: پوشش نماینده ساعت/روز از هفته/تعطیلات.
9) خارج از سیاست/ورود به سیستم داده ها و علیت
10) تشخیص نمایندگی
مقایسه حاشیه ای: جدول جمعیت در مقابل نمونه توسط ویژگی های کلیدی.
تعادل covariates: SMD (استاندارد میانگین تفاوت)، قطعه عشق.
تراکم/چندک: آزمون KS، قطعه چندک، PSI.
صلاحیت مدل: تثبیت معیارها در برش های خارج از زمان و خارج از دامنه.
ESS و وزن: ESS پایین نشان می دهد واریانس بالا در نمرات.
11) ضد الگوهای
«نمونه فقط دیروز فعال است» → از دست دادن سرما/خواب.
میانگین درصد «بخش متوسط» بدون وزن.
مخلوط سطح تجمع (رویدادها و کاربران) در یک نمونه.
انتخاب تصادفی پس از فیلترهای وابسته به هدف (انتخاب در نتیجه).
Cross-val بدون تقسیم گروه/زمان با داده های وابسته.
درخواست SMOTE قبل از قطار/وال (نشت).
12) سناریوهای خصوصی (موارد)
نظرسنجی بازیکن: طبقه بندی شده توسط کشور/پلت فرم/سن ؛ پس از طبقه بندی به سهام MAU ؛ عدم پاسخ کنترل افست.
سیاهههای مربوط به EDA: نمونه سیستماتیک 1:N رویداد + پوشش کامل انواع نادر.
تشخیص تقلب: طبقه بندی هدف، از دست دادن حساس به هزینه، نمره PR-AUC و Recall@FPR≤x٪.
A/B با ترافیک محدود: محاسبات MDE، تجدید قانون قدرت، CUPED.
تبلیغی ارزیابی خارج از سیاست: IPS/DR با محدودیت وزن (پیرایش)، بررسی همپوشانی پشتیبانی.
13) الگوهای مصنوعی
طرح نمونه برداری (قالب)
هدف/جمعیت:...
جعبه نمونه برداری: منابع، پوشش/سوراخ
واحد انتخاب: کاربر/جلسه/رویداد
طراحی: اقشار (کشور، پلت فرم)، سهام، روش انتخاب
اندازه (n): محاسبات، مفروضات (α، قدرت، MDE)، Deff
طرح وزن: وزن طراحی، پس از طبقه بندی (مجموع کنترل)
تقویم: روز/ساعت/پوشش تعطیلات
کیفیت: آزمون های پوشش، طرح عدم پاسخ، روش های تماس
خطرات: انتخاب، دخالت، حریم خصوصی/PII
صاحبان و کنترل: که شمارش/فروشگاه/نسخه
وزن گذرنامه (قالب)
وزن پایه: (w_i=1/\pi_i)
کالیبراسیون: اهداف (کشور، پلت فرم، سن)، روش (جمع آوری)، تحمل
محدودیت ها: پیرایش w ∈ [w_min، w_max]
تشخیص: ESS، CV (w)، SMD قبل/بعد
استفاده: که گزارش/مدل اعمال وزن
نسخه ها: v1 → v2، تاریخ، صاحبان
14) حریم خصوصی و اخلاق
حریم خصوصی توسط طراحی: به حداقل رساندن زمینه، تجمع، pseudonymization.
حریم خصوصی دیفرانسیل: تصادفی/subsampling به عنوان تقویت حریم خصوصی.
عدالت: بررسی تفاوت خطا/وزن در برابر ویژگی های حساس ؛ اجازه ندهید که گروه ها «نامرئی» باشند.
15) چک لیست قبل از شروع
- جعبه نمونه برداری شرح داده شده است ؛ سوراخ های پوشش شناسایی و مستند شده است
- طرح انتخاب شده (لایه ها/خوشه ها)، محاسبه شده (n)، Deff، MDE
- تنظیم وزن طراحی و برنامه کالیبراسیون (مجموع کنترل موافقت کرد)
- پنجره های زمان/فصلی تعریف شده ؛ یک طرح بدون پاسخ وجود دارد
- تقسیم اعتبار در نظر گرفتن زمان/گروه ؛ بدون نشت
- معیارهای کیفیت: ESS، SMD، PSI، فواصل بوت استرپ
- مستندات و نسخه ها ؛ حقوق دسترسی و حریم خصوصی بررسی شده است
واژه نامه کوتاه
Deff: ضریب افزایش واریانس نمرات به دلیل طراحی.
ESS: اندازه نمونه موثر پس از وزن.
IPS/DR: روش های وزن برای داده های خارج از سیاست/ورود به سیستم.
SMD: میانگین تفاوت استاندارد (تعادل کوواریته).
نمونه برداری مخزن: حفظ یک نمونه تصادفی از جریان.
مجموع
نمایندگی «خوش شانسی با نمونه» نیست، بلکه یک فرایند طراحی شده است: یک قاب صحیح، طراحی انتخاب متفکرانه، اندازه کافی، وزن و کالیبراسیون، تقسیم صادقانه و تشخیص دقیق. با پیروی از شیوه های شرح داده شده، تعصب را کاهش می دهید، قابلیت اطمینان نتیجه گیری را افزایش می دهید و راه حل های قابل اعتماد برای محصول، بازاریابی، ریسک و ML را دریافت می کنید.