Logo GH

نمونه برداری و نمایندگی

نمونه برداری و نمایندگی

نمونه برداری انتخاب یک زیر مجموعه از مشاهدات برای اندازه گیری ها، آزمایش ها و آموزش مدل است. نمایندگی به این معنی است که نتیجه گیری از نمونه به جمعیت هدف بدون تعصب مقیاس می شود. در زیر نحوه طراحی یک نمونه، ارزیابی کیفیت آن و جبران صحیح است.

1) مفاهیم اساسی

جمعیت: مجموعه ای از اشیاء هدف (همه کاربران/جلسات/معاملات).
قاب نمونه برداری: لیست/مکانیسم که از آن ما در واقع انتخاب (مهم است که برای شناسایی پوشش و «سوراخ»).
واحد انتخاب: کاربر، جلسه، رویداد، معامله، دستگاه.
نمایندگی: تطبیق توزیع ویژگی های کلیدی در نمونه و جمعیت (با تحمل خطای تصادفی).
تصادفی در مقابل تعصب: واریانس برآوردها در مقابل تعصب (تعصب).

2) انواع نمونه گیری

2. 1 احتمالی (ترجیح داده شده)

SRS (تصادفی ساده): احتمال انتخاب برابر است.
طبقه بندی شده: جمعیت طبقه بندی شده (کشور/کانال/پلت فرم)، سپس SRS در لایه ها → واریانس پایین تر و پوشش بهتر.
خوشه: انتخاب گروه ها (روزها/سرورها/فروشگاه ها) ؛ ارزان اما همبستگی درون خوشه ای بالاتر.
سیستماتیک: هر عنصر kth پس از شروع تصادفی (داده های «آسنکرون» مورد نیاز).
PPS (احتمال متناسب با اندازه) - احتمال ∝ اندازه واحد (به عنوان مثال، حجم ترافیک شریک).

2. 2 باور نکردنی (با احتیاط)

امکانات/داوطلبان: نظرسنجی سریع، «کلیک کردن» سیاهههای مربوط → خطر تعصب انتخاب.
سهمیه/گلوله برفی: در گروه های طاقچه مفید است، اما کالیبراسیون بعدی لازم است.

3) منابع جابجایی

پوشش: بخشی از جمعیت در قاب نیست (به عنوان مثال، داده های iOS هنگام ردیابی ممنوع است).
انتخاب: مکانیسم انتخاب با متغیر هدف همراه است (فعال تر اغلب سقوط می کند).
عدم پاسخ: بی پاسخ ها به طور سیستماتیک متفاوت هستند.
بازماندگان: نادیده گرفتن رفتگان/مسدود شده.
برچسب افست: برچسب های پر سر و صدا، برچسب های پروکسی، تنظیمات «دستی».
چهره ها: استفاده از اطلاعات آینده در شکل گیری نمونه/ویژگی.

4) اندازه نمونه و قدرت

4. 1 تقریب ها

برای کسر (p) با دقت (e) و اطمینان (1-\alpha):
[
n\approximate\frac {z _ {\alpha/2} ^ 2, p (1-p)} {e ^ 2}
]

ما محافظه کارانه می گیریم (p = 0 {.} 5). در صورت لزوم جمعیت نهایی را تنظیم کنید.

برای متوسط با شناخته شده (\sigma):
[
n\approximate\left (\frac {z _ {\alpha/2} ,\sigma} {e }\right) ^ 2
]

4. 2 اثر طراحی و اندازه موثر

اثر طراحی: (\mathrm {Deff} = 1 + (m-1 )\rho)، جایی که (m) اندازه خوشه است، (\rho) همبستگی درون خوشه ای است.
اندازه موثر: (n_\text{eff}=n/\mathrm{Deff}). طرح های خوشه ای/وزنی اغلب نیاز به تعداد بیشتری (n) دارند.

4. 3 A/B و MDE

برای یک متریک دودویی با گروههای متقارن:
[
n_{\text{на группу }\تقریبا\frac {2 (z_{1-\alpha/2}+z_{1-\beta}) ^ 2 ,\bar {p} (1-\bar {p})} {\mathrm {MDE} ^ 2}
]

که در آن (\bar {p}) سطح پایه است، MDE اثر حداقل قابل تشخیص است.
فصلی و تداخل (سرریز) را در نظر بگیرید، CUPED/covariates را برای کاهش واریانس اعمال کنید.

5) وزن و کالیبراسیون (ما نمونه «مشابه» را به جمعیت)

وزن طراحی: (w_i=1/\pi_i) (احتمال معکوس انتخاب).
پس از طبقه بندی و جمع آوری: ما حاشیه وزن (کشور/پلت فرم/جنسیت سن، و غیره) را به بخش های شناخته شده تنظیم می کنیم.
وزن کالیبراسیون: به حداقل رساندن انحراف از وزن زمانی که دقیقا همزمان با مجموع کنترل.
بوت استرپ/تکرار: برآورد صحیح واریانس در وزن.
تشخیص: ESS (اندازه نمونه موثر)، گسترش وزن (CV، p95/p5)، قبل/بعد از مقایسه با ویژگی های کلیدی.

6) عدم تعادل کلاس و حوادث نادر

انتخاب طبقه بندی شده توسط هدف: oversample یک کلاس نادر است، اما همیشه از تنظیم آستانه/وزن در آموزش استفاده کنید.
یادگیری حساس به هزینه: از دست دادن وزن به جای مصنوعی.
SMOTE/ADASYN: احتیاط - خطر نشت/مصنوعات ؛ زمان دقیق/تقسیم گروه را نگه دارید.
رتبه: PR-AUC، Recall@FPR≤x٪ ؛ کالیبراسیون احتمال.

7) جریان و داده های بزرگ

نمونه برداری از مخزن: یک زیر مجموعه نماینده را از یک جریان با طول ناشناخته نگه دارید.
نمونه برداری رویداد: متناسب با فرکانس/اهمیت ؛ برای نادر - بافر ماشه.
شمارنده و طرح: بلوم/تعداد مین برای فرکانس/منحصر به فرد ؛ برای تجزیه و تحلیل - ترکیب با شمارش دقیق دوره ای.
De-dup و idempotency - کلید های رویداد، پنجره های deduplication.

8) جنبه های زمانی و فضایی

نمونه برداری مبتنی بر زمان: پنجره های ثابت (نورد)، نقطه در زمان صحت.
خوشه/جغرافیایی نمونه برداری: خوشه بندی توسط گره/منطقه ؛ خود همبستگی فضایی را در نظر بگیرید.
فصلی/ریتم: پوشش نماینده ساعت/روز از هفته/تعطیلات.

9) خارج از سیاست/ورود به سیستم داده ها و علیت

IPS (گرایش معکوس): (w_i=1/\pi (a_ix_i)) برای اصلاح نمونه های ورود به سیستم برای سیاست جدید.
نمرات DR: دو برابر قوی برای کاهش تعصب و واریانس.
حمل و نقل - نتایج انتقال بین بازارها/کانال ها - برای تغییر کوواریته بررسی کنید
تغییر برچسب: (P (y)) تغییرات در ثبات (P (x)) ؛ از EM/recalibration استفاده کنید.

10) تشخیص نمایندگی

مقایسه حاشیه ای: جدول جمعیت در مقابل نمونه توسط ویژگی های کلیدی.
تعادل covariates: SMD (استاندارد میانگین تفاوت)، قطعه عشق.
تراکم/چندک: آزمون KS، قطعه چندک، PSI.
صلاحیت مدل: تثبیت معیارها در برش های خارج از زمان و خارج از دامنه.
ESS و وزن: ESS پایین نشان می دهد واریانس بالا در نمرات.

11) ضد الگوهای

«نمونه فقط دیروز فعال است» → از دست دادن سرما/خواب.
میانگین درصد «بخش متوسط» بدون وزن.
مخلوط سطح تجمع (رویدادها و کاربران) در یک نمونه.
انتخاب تصادفی پس از فیلترهای وابسته به هدف (انتخاب در نتیجه).
Cross-val بدون تقسیم گروه/زمان با داده های وابسته.
درخواست SMOTE قبل از قطار/وال (نشت).

12) سناریوهای خصوصی (موارد)

نظرسنجی بازیکن: طبقه بندی شده توسط کشور/پلت فرم/سن ؛ پس از طبقه بندی به سهام MAU ؛ عدم پاسخ کنترل افست.
سیاهههای مربوط به EDA: نمونه سیستماتیک 1:N رویداد + پوشش کامل انواع نادر.
تشخیص تقلب: طبقه بندی هدف، از دست دادن حساس به هزینه، نمره PR-AUC و Recall@FPR≤x٪.
A/B با ترافیک محدود: محاسبات MDE، تجدید قانون قدرت، CUPED.
تبلیغی ارزیابی خارج از سیاست: IPS/DR با محدودیت وزن (پیرایش)، بررسی همپوشانی پشتیبانی.

13) الگوهای مصنوعی

طرح نمونه برداری (قالب)

هدف/جمعیت:...

جعبه نمونه برداری: منابع، پوشش/سوراخ

واحد انتخاب: کاربر/جلسه/رویداد

طراحی: اقشار (کشور، پلت فرم)، سهام، روش انتخاب

اندازه (n): محاسبات، مفروضات (α، قدرت، MDE)، Deff

طرح وزن: وزن طراحی، پس از طبقه بندی (مجموع کنترل)

تقویم: روز/ساعت/پوشش تعطیلات

کیفیت: آزمون های پوشش، طرح عدم پاسخ، روش های تماس

خطرات: انتخاب، دخالت، حریم خصوصی/PII

صاحبان و کنترل: که شمارش/فروشگاه/نسخه

وزن گذرنامه (قالب)

وزن پایه: (w_i=1/\pi_i)

کالیبراسیون: اهداف (کشور، پلت فرم، سن)، روش (جمع آوری)، تحمل

محدودیت ها: پیرایش w ∈ [w_min، w_max]

تشخیص: ESS، CV (w)، SMD قبل/بعد

استفاده: که گزارش/مدل اعمال وزن

نسخه ها: v1 → v2، تاریخ، صاحبان

14) حریم خصوصی و اخلاق

حریم خصوصی توسط طراحی: به حداقل رساندن زمینه، تجمع، pseudonymization.
حریم خصوصی دیفرانسیل: تصادفی/subsampling به عنوان تقویت حریم خصوصی.
عدالت: بررسی تفاوت خطا/وزن در برابر ویژگی های حساس ؛ اجازه ندهید که گروه ها «نامرئی» باشند.

15) چک لیست قبل از شروع

  • جعبه نمونه برداری شرح داده شده است ؛ سوراخ های پوشش شناسایی و مستند شده است
  • طرح انتخاب شده (لایه ها/خوشه ها)، محاسبه شده (n)، Deff، MDE
  • تنظیم وزن طراحی و برنامه کالیبراسیون (مجموع کنترل موافقت کرد)
  • پنجره های زمان/فصلی تعریف شده ؛ یک طرح بدون پاسخ وجود دارد
  • تقسیم اعتبار در نظر گرفتن زمان/گروه ؛ بدون نشت
  • معیارهای کیفیت: ESS، SMD، PSI، فواصل بوت استرپ
  • مستندات و نسخه ها ؛ حقوق دسترسی و حریم خصوصی بررسی شده است

واژه نامه کوتاه

Deff: ضریب افزایش واریانس نمرات به دلیل طراحی.
ESS: اندازه نمونه موثر پس از وزن.
IPS/DR: روش های وزن برای داده های خارج از سیاست/ورود به سیستم.
SMD: میانگین تفاوت استاندارد (تعادل کوواریته).
نمونه برداری مخزن: حفظ یک نمونه تصادفی از جریان.

مجموع

نمایندگی «خوش شانسی با نمونه» نیست، بلکه یک فرایند طراحی شده است: یک قاب صحیح، طراحی انتخاب متفکرانه، اندازه کافی، وزن و کالیبراسیون، تقسیم صادقانه و تشخیص دقیق. با پیروی از شیوه های شرح داده شده، تعصب را کاهش می دهید، قابلیت اطمینان نتیجه گیری را افزایش می دهید و راه حل های قابل اعتماد برای محصول، بازاریابی، ریسک و ML را دریافت می کنید.

Contact

با ما در تماس باشید

برای هرگونه سؤال یا نیاز به پشتیبانی با ما ارتباط بگیرید.ما همیشه آماده کمک هستیم!

Telegram
@Gamble_GC
شروع یکپارچه‌سازی

ایمیل — اجباری است. تلگرام یا واتساپ — اختیاری.

نام شما اختیاری
ایمیل اختیاری
موضوع اختیاری
پیام اختیاری
Telegram اختیاری
@
اگر تلگرام را وارد کنید — علاوه بر ایمیل، در تلگرام هم پاسخ می‌دهیم.
WhatsApp اختیاری
فرمت: کد کشور و شماره (برای مثال، +98XXXXXXXXXX).

با فشردن این دکمه، با پردازش داده‌های خود موافقت می‌کنید.