Logo GH

דגימה וייצוג

דגימה וייצוג

דגימה היא בחירה של תת-קבוצה של תצפיות למדידות, ניסויים ואימוני מודל. ייצוג פירושו שמסקנות המדגם מועברות לאוכלוסיית היעד ללא הטיה. להלן, כיצד לעצב דגימה, להעריך את איכותה ולתקן קיזוזים.

1) מושגים בסיסיים

אוכלוסייה: קבוצת מטרות של אובייקטים (כל המשתמשים/הפעלות/עסקאות).
מסגרת דגימה: רשימה/מנגנון שממנו אנו בוחרים (חשוב לזהות ציפויים ו ”חורים”).
יחידת בחירה: משתמש, הפעלה, אירוע, עסקה, התקן.
ייצוג: התאמת מאפייני מפתח התפלגויות במדגם ובאוכלוסייה (עם סובלנות שגיאה אקראית).
הטיה אקראית נגד: שונות של הערכות לעומת הטיה (הטיה).

2) סוגי דגימות

2. הסתברות 1 (מועדף)

SRS (אקראי פשוט): הסתברות שווה לבחירה.
Stratified: stratished population (ארץ/ערוץ/פלטפורמה), ולאחר מכן SRS בתוך strata = שוני נמוך יותר וכיסוי טוב יותר.
אשכול: בחירת קבוצות (ימים/שרתים/חנויות); מתאם זול אך גבוה יותר.
סיסטמטית: כל אלמנט kth לאחר התחלה אקראית (”asynchronous” design).
PPS (הסתברות ביחס לגודל) - הסתברות ∝ גודל יחידה (לדוגמה, נפח תנועה של שותף).

2. 2 מדהים (בזהירות)

נוחות/מתנדבים: סקרים מהירים, רישומי ”לחיצה” = הסיכון של הטיית בחירה.
מכסה/כדור שלג: שימושי בקבוצות נישה, אבל יש צורך בכיול לאחר מכן.

3) מקורות העברה

כיסוי: חלק מהאוכלוסייה אינו נמצא במסגרת (לדוגמה, נתוני iOS בעת מעקב אסורים).
בחירה: מנגנון הבחירה קשור למשתנה המטרה (פעיל לעתים קרובות יותר נופל).
אל תגיבו: הלא ־ מגיבים שונים באופן שיטתי.
התעלמות מהמנוחה/חסומה.
תווית: תגיות רועשות, תוויות פרוקסי, התאמות ”ידניות”.
פרצופים: שימוש במידע עתידי בהיווצרות המדגם/תכונה.

4) גודל דוגמית וכוח

4. 1 קירוב

עבור שבר (p) עם דיוק (e) וביטחון (1 -\אלפא):
[
n\associex\frac _ z _\alpha/2 _ 2, p (1-p) _ 2
]

אנחנו לוקחים באופן שמרני (p = 0 5). להסתגל לאוכלוסייה סופית אם יש צורך.

עבור מדיום עם ידוע (\סיגמא):
[
n\associex/left (\frac {z _\alpha/2} ,\sigma @ e\right _ 2
]

4. 2 אפקט תכנון וגודל יעיל

אפקט עיצוב: (\mathrm {Deff} = 1 + (m-1\rho), כאשר (m) הוא גודל האשכול, (\rho) הוא מתאם אינטרה-אשכול.
גודל יעיל: (n_\text{eff}=n/\mathrm{Deff}). העיצובים של אשכול/משוקלל דורשים לעתים יותר (n).

4. 3 A/B ו ־ MDE

עבור מטריקה בינארית עם קבוצות סימטריות:
[
n_{\text{на averyaughtshouth d'\authix\frac _ 2 (z_{1-\alpha/2}+z_{1-\beta}) ä2 ,\bar (1\bar _ p)] {\mathrm {MDE} ä2}

]

היכן (\bar _ p) היא רמת הבסיס, MDE היא האפקט שניתן להבחין בו באופן מינימלי.
תן דעתך לעונות ים והתאבכות (spillover), הפעל את CUPED/covariates כדי להפחית את השונות.

5) משקולות וכיול (אנו דוגמים ”דומה” לאוכלוסייה)

עיצוב משקולות: (w_i=1/\pi_i) (הסתברות הפוכה לבחירה).
פוסט-סטרטיפיקציה וגריפה: אנו מכוונים את השוליים המשוקללים (מדינה/פלטפורמה/גיל המגדר וכו ') לשברים הידועים.
משקולת כיול: למזער את סטיית המשקולות כאשר בדיוק במקביל לסכומי השליטה.
אתחול/שכפול: הערכה נכונה של וריאציות במשקולות.
אבחון: ESS (גודל מדגם יעיל), פיזור משקל (CV, p95/p5), לפני/לאחר השוואה על ידי תכונות מפתח.

6) חוסר איזון ברמה ואירועים נדירים

בחירה מסודרת על ידי מטרה: מגבר יתר הוא סוג נדיר, אבל תמיד להשתמש סף/התאמת משקל באימונים.
למידה רגישה לעלויות: הפסדים כבדים במקום סינתטיים.
SMOTE/ADASYN: זהירות - סיכון של דליפות/חפצים; שמור פיצול זמן/קבוצה קפדני.
דירוג: PR-AUC, Recall @ FPR lox%; כיול הסתברות.

7) זרימה ונתונים גדולים

דגימת מאגר: החזק תת ־ קבוצה ייצוגית מזרם באורך לא ידוע.
דגימת אירוע: פרופורציונלי לתדר/חשיבות; לחיצוצים נדירים.
דלתות ורישומים: Bloom/Count-Min עבור תדרים/ייחודיות; לניתוח - לשלב עם ספירה מדויקת תקופתית.
דה-דופ ואידמפוטנטיות - מפתחות אירוע, חלונות שכפול.

8) היבטים זמניים ומרחביים

דגימה מבוססת זמן: חלונות קבועים (מתגלגלים), תקינות נקודה בזמן.
אשכול/דגימת גיאו: התקבצות באמצעות צומת/אזור; שקול אוטוקורלציה מרחבית.
עונה/קצב: סיקור מייצג של שעות/ימים בשבוע/חגים.

9) נתוני off-policy/log וסיבתיות

IPS (נטייה הפוכה): (w_i=1/\pi (a_ix_i)) לתקן דגימות רישום למדיניות החדשה.
ד "ר ציונים: חזק כפליים כדי להפחית הטיה ושונות.
העברה - העברה של תוצאות בין שווקים/ערוצים - בדוק אם יש שינוי קווריאט
שינוי בתווית: (P (Y משתנה ביציבות (P (xy); השתמש בכיול EM/recibration.

10) אבחון ייצוגי

השוואה שולית: טבלאות אוכלוסיית נגד מדגם על ידי תכונות מפתח.
מאזן של קובריאטים: SMD (הבדל ממוצע סטנדרטי), עלילות אהבה.
צפיפות/כמויות: בדיקות KS, עלילות כמויות, PSI.
אימות מודל: ייצוב של מדדים על מחוץ לזמן וחוץ לתחום פרוסות.
אס אס ומשקולות: אס אס נמוך מסמן שוני גבוה בציונים.

11) אנטי דפוסים

”מדגם פעיל רק אתמול” = אובדן של קרים/רדומים.
אחוז ממוצע ”ממוצע קטע” ללא משקולות.
שילוב רמות הצבירה (אירועים ומשתמשים) במדגם אחד.
בחירה אקראית לאחר מסננים תלויי מטרה (בחירה על התוצאה).
קרוס-ואל ללא פיצול קבוצה/זמן עם נתונים תלויים.
הפעל SMOTE לפני הרכבת/ואל (דליפה).

12) תרחישים פרטיים (מקרים)

סקר נגנים: מסומן על ידי מדינה/פלטפורמה/גיל; פוסט-סטרטיפיקציה למניות MAU; בקרת קיזוז ללא תגובה.
יומנים עבור EDA: דגימת אירוע 1:N שיטתית + כיסוי מלא של סוגים נדירים.
זיהוי הונאה: Stratification יעד, אובדן רגיש עלות, ציון PR-AUC ו Recall @ FPR loox x%.
A/B עם תנועה מוגבלת: חישוב MDE, חידוש כלל כוח, CUPED.
פרומו הערכה מחוץ למדיניות: IPS/DR עם הגבלת משקל (קיזוז), בדיקת חפיפה תומכת.

13) תבניות חפץ

תוכנית דגימה (תבנית)

יעד/אוכלוסייה:...

תיבת דגימה: מקורות, כיסוי/חורים

יחידת בחירה: משתמש/הפעלה/אירוע

עיצוב: סטרטה (מדינה, פלטפורמה), מניות, שיטת בחירה

גודל (n): חישובים, הנחות (_, כוח, MDE), Deff

ערכת משקל: משקולות עיצוב, פוסט-סטרטיפיקציה (מכלול בקרה)

לוח שנה: יום/שעה/סיקור החג

איכות: בדיקות כיסוי, תוכנית ללא תגובה, הליכי מגע

סיכונים: בחירה, הפרעה, פרטיות/מח "ש

בעלים ובקרה: מי סופר/חנויות/גרסאות

שוקל דרכון (תבנית)

משקולות בסיס: (w_i=1/\pi_i)

כיול: מטרות (מדינה, פלטפורמה, גיל), שיטה (גריפה), סובלנות

הגבלות: קיצוץ [ w_min, w_max ]

אבחון: ESS, CV (W), SMD לפני/אחרי

שימוש: אילו דיווחים/מודלים מיישמים משקולות

גרסאות: v1 # v2, תאריך, בעלים

14) פרטיות ואתיקה

פרטיות בעיצוב: מזעור שדה, צבירה, פסאודונימיזציה.
פרטיות דיפרנציאלית: אקראיות/הגברה כפרטיות.
הגינות: בדוק הפרשי שגיאה/משקל כנגד תכונות רגישות; לא לאפשר לקבוצות להיות ”בלתי נראות”.

15) רשימת בדיקות טרום התחלה

[ ] תיבת הדגימה מתוארת; חורי ציפוי שזוהו ותועדו
[ ] עיצוב נבחר (שכבות/אשכולות), מחושב (n), Deff, MDE
[ ] הגדרת משקולות עיצוב ותוכנית כיול (טוטלי שליטה הסכימו)
[ ] חלונות זמן/עונה מוגדרים; יש תוכנית של אי-תגובה
[ ] אימות פיצול לשקול זמן/קבוצות; אין דליפות
[ מדדי איכות ]: ESS, SMD, PSI, מרווחי אתחול
[ ] תיעוד וגרסאות; זכויות גישה וקשרי פרטיות בדקו

מיני גלוסרי

Deff: מכפיל הגדלת שונות של ציונים בשל עיצוב.
אס: גודל דגימה יעיל לאחר המשקולת.
IPS/DR: שיטות שיקול עבור נתונים מחוץ למדיניות/רישום.
SMD: הבדל ממוצע סטנדרטי (מאזן קובארי).
דגימת מאגר: שמירה על דגימה אקראית מהזרם.

סך הכל

ייצוג אינו ”בר מזל עם המדגם”, אלא תהליך מעוצב: מסגרת נכונה, עיצוב בחירה מתחשב, גודל מספיק, משקל וכיול, פיצול ישר ואבחנה קפדנית. על ידי הפעולות המתוארות, אתה מפחית הטיה, מגביר את הניידות של מסקנות ומקבל פתרונות אמינים למוצר, שיווק, סיכון ו ML.

Contact

צרו קשר

פנו אלינו בכל שאלה או צורך בתמיכה.אנחנו תמיד כאן כדי לעזור.

Telegram
@Gamble_GC
התחלת אינטגרציה

Email הוא חובה. Telegram או WhatsApp — אופציונליים.

השם שלכם לא חובה
Email לא חובה
נושא לא חובה
הודעה לא חובה
Telegram לא חובה
@
אם תציינו Telegram — נענה גם שם, בנוסף ל-Email.
WhatsApp לא חובה
פורמט: קידומת מדינה ומספר (לדוגמה, +972XXXXXXXXX).

בלחיצה על הכפתור אתם מסכימים לעיבוד הנתונים שלכם.