नमूना और प्रतिनिधित्व
नमूना और प्रतिनिधित्व
नमूना माप, प्रयोगों और मॉडल प्रशिक्षण के लिए टिप्पणियों के सबसेट का चयन है। प्रतिनिधित्व का मतलब है कि नमूने से निष्कर्ष पूर्वाग्रह के बिना लक्ष्य आबादी को बढ़ाया जाता है। नीचे एक नमूना डिजाइन करने, इसकी गुणवत्ता और सही ऑफसेट का मूल्यांकन करने का तरीका है।
1) बुनियादी अवधारणाएं
जनसंख्या: वस्तुओं का लक्ष्य सेट (सभी उपयोगकर्ता/सत्र/लेनदेन)।
नमूना फ्रेम: सूची/तंत्र जिससे हम वास्तव में चयन करते हैं (कोटिंग्स और "छेद" की पहचान करना महत्वपूर्ण है)।
चयन की इकाई: उपयोगकर्ता, सत्र, घटना, लेनदेन, उपकरण।
प्रतिनिधित्व: नमूना और जनसंख्या (यादृच्छिक त्रुटि सहिष्णुता के साथ) में कुंजी विशेषता वितरण का मिलान।
यादृच्छिक बनाम पूर्वाग्रह: अनुमानों बनाम पूर्वाग्रह (पूर्वाग्रह) का विचरण।
2) नमूने के प्रकार
2. 1 संभाव्य (पसंदीदा)
एसआरएस (सरल यादृच्छिक): चयन की समान संभावना।
स्तरीकृत: स्तरीकृत जनसंख्या (देश/चैनल/मंच), फिर SRS स्ट्रेटा → कम विचरण और बेहतर कवरेज के भीतर।
समूह: समूहों का चयन (दिन/सर्वर/स्टोर); सस्ता लेकिन उच्च इंट्राक्लस्टर सहसंबंध।
व्यवस्थित: यादृच्छिक शुरुआत के बाद प्रत्येक kth तत्व ("अतुल्यकालिक" डेटा आवश्यक)।
पीपीएस (आकार के अनुपात में संभावना) - संभावना ∝ इकाई आकार (उदाहरण के लिए, भागीदार यातायात मात्रा)।
2. 2 अतुल्य (सावधानी के साथ)
सुविधाएं/स्वयंसेवक: त्वरित चुनाव, "क्लिक" लॉग - चयन पूर्वाग्रह का जोखिम।
कोटा/स्नोबॉल: आला समूहों में उपयोगी, लेकिन बाद में अंशांकन की आवश्यकता है।
3) विस्थापन के स्रोत
कवरेज: आबादी का हिस्सा फ्रेम में नहीं है (उदाहरण के लिए, ट्रैकिंग निषिद्ध होने पर iOS डेटा)।
चयन: चयन तंत्र लक्ष्य चर (सक्रिय रूप से अधिक बार गिरने) के साथ जुड़ा हुआ है।
गैर-जिम्मेदार: गैर-जिम्मेदार व्यवस्थित रूप से अलग हैं।
उत्तरजीवी: दिवंगत/अवरुद्ध को अनदेखा करना।
ऑफसेट लेबल: शोर टैग, प्रॉक्सी लेबल, "मैनुअल" समायोजन।
चेहरा: नमूना/सुविधा के गठन में भविष्य की जानकारी का उपयोग।
4) नमूना आकार और शक्ति
4. 1 अनुमान
परिशुद्धता (ई) और विश्वास के साथ भिन्न (p) के लिए (1- é अल्फा):[
n ~ actox × frac {z _ q alpha/2} ^ 2, p (1-p)} {e ^ 2}
]
हम रूढ़िवादी रूप से लेते हैं (p = 0 {} 5)। यदि आवश्यक हो तो अंतिम जनसंख्या के लिए समायो
ज्ञात के साथ माध्यम के लिए (é सिग्मा):[
n × autax × lead (é frac {z _ {łalpha/2}, łsigma} {e} दाएं) ^ 2
]
4. 2 डिजाइन प्रभाव और प्रभावी आकार
डिजाइन प्रभाव: (łmathrm {Deff} = 1 + (m-1)· rho), जहां (m) क्लस्टर आकार है, (é rho) इंट्रा-क्लस्टर सहसंबंध है।
प्रभावी आकार: (n_\text{eff}=n/\mathrm{Deff})। क्लस्टर/भारित डिजाइनों को अक्सर अधिक (एन) की आवश्यकता होती है।
4. 3 ए/बी और एमडीई
सममित समूहों के साथ एक द्विआधारी मीट्रिक के लिए:[
n_{\text{на группу}· आस्तिक्स फ्रैक {2 (z_{1-\alpha/2}+z_{1-\beta}) ^ 2,· बार {p} (1- × बार {p})} {{mathrm {MDE} 2}
]
जहां (· bar {p}) आधार स्तर है, MDE न्यूनतम पता लगाने योग्य प्रभाव है।
मौसमी और हस्तक्षेप (स्पिलओवर) पर विचार करें, विचरण को कम करने के लिए CUPED/सहसंयोजक लागू करें।
5) वजन और अंशांकन (हम आबादी के समान "नमूना" करते हैं)
डिजाइन वजन: (w_i=1/\pi_i) (चयन की व्युत्क्रम संभावना)।
पोस्ट-स्तरीकरण और रेकिंग: हम ज्ञात अंशों के लिए भारित सीमांत (देश/मंच/लिंग-आयु, आदि) को समायोजित करते हैं।
कैलिब्रेशन वेटिंग: नियंत्रण योग के साथ मेल खाने पर वजन के विचलन को कम से कम करें।
बूटस्ट्रैप/प्रतिकृति: वजन पर भिन्नता का सही अनुमान।
निदान: ईएसएस (प्रभावी नमूना आकार), वजन प्रसार (सीवी, पी 95/पी 5), प्रमुख विशेषताओं द्वारा तुलना से पहले/बाद में।
6) वर्ग असंतुलन और दुर्लभ घटनाएँ
लक्ष्य द्वारा स्तरीकृत चयन: ओवरसैम्पल एक दुर्लभ वर्ग है, लेकिन हमेशा प्रशिक्षण में सीमा/वजन समायोजन का उपयोग करें।
लागत-संवेदनशील सीखना: सिंथेटिक्स के बजाय भारित नुकसान।
SMOTE/ADASYN: सावधानी - लीक/कलाकृतियों का जोखिम; सख्त समय/समूह विभाजन रखें।
रेटिंग: पीआर-एयूसी, Recall@FPR≤x%; संभावना अंशांकन।
7) स्ट्रीमिंग और बिग डेटा
जलाशय का नमूना: अज्ञात लंबाई की एक धारा से एक प्रतिनिधि सबसेट पकड़ें।
घटना का नमूना: आवृत्ति/महत्व के आनुपातिक; दुर्लभ - ट्रिगर बफर्स के लिए।
काउंटर और रेखाचित्र: आवृत्तियों/विशिष्टता के लिए ब्लूम/काउंट-मिन; एनालिटिक्स के लिए - आवधिक सटीक गिनती के साथ मिलाएं।
De-dup और idempotency - घटना कुंजी, deduplication विंडो।
8) टेम्पोरल और स्थानिक पहलू
समय-आधारित नमूना: निश्चित खिड़कियां (रोलिंग), बिंदु-इन-टाइम शुद्धता।
क्लस्टर/भू-नमूना: नोड/क्षेत्र द्वारा क्लस्टरिंग; स्थानिक स्वतः संबंध पर विचार करें।
मौसमी/लय: सप्ताह के घंटों/दिनों/छुट्टियों का प्रतिनिधि कवरेज।
9) ऑफ-पॉलिसी/लॉग डेटा और कारण
10) प्रतिनिधित्व निदान
सीमांत तुलना: प्रमुख विशेषताओं द्वारा तालिकाओं की आबादी बनाम नमूना।
कोवरिएट्स का संतुलन: एसएमडी (मानकीकृत औसत अंतर), लव प्लॉट।
घनत्व/मात्रा: केएस परीक्षण, मात्रा-भूखंड, पीएसआई।
मॉडल योग्यता: आउट-ऑफ-टाइम और आउट-ऑफ-डोमेन स्लाइस पर मैट्रिक्स का स्थिरीकरण।
ईएसएस और वजन: कम ईएसएस स्कोर में उच्च विचरण का संकेत देता है।
11) एंटी-पैटर्न
"नमूना केवल कल सक्रिय" - ठंड/स्लीपर्स का नुकसान।
वजन के बिना औसत प्रतिशत "खंड औसत"।
एक नमूने में एकत्रीकरण स्तर (घटनाओं और उपयोगकर्ताओं) को मिलाएं।
लक्ष्य-निर्भर फिल्टर (परिणाम पर चयन) के बाद यादृच्छिक चयन।
निर्भर डेटा के साथ समूह/समय विभाजन के बिना क्रॉस-वैल।
ट्रेन/वैल (लीक) से पहले SMOTE लागू करें।
12) निजी परिदृश्य (मामले)
खिलाड़ी सर्वेक्षण: देश/मंच/आयु द्वारा स्तरीकृत; MAU शेयरों के बाद का स्तरीकरण; गैर-जिम्मेदार ऑफसेट नियंत्रण।
EDA के लिए लॉग: व्यवस्थित 1:N घटना नमूना + दुर्लभ प्रकारों का पूर्ण कवरेज।
धोखाधड़ी का पता लगाना: लक्ष्य स्तरीकरण, लागत-संवेदनशील नुकसान, पीआर-एयूसी स्कोर और Recall@FPR≤x%।
प्रतिबंधित यातायात के साथ ए/बी: एमडीई गणना, बिजली नियम नवीकरण, CUPED।
ऑफ-पॉलिसी मूल्यांकन प्रोमो: आईपीएस/डीआर वेट लिमिटेशन (ट्रिमिंग) के साथ, ओवरलैप चेक का समर्थन करें।
13) कलाकृतियाँ पैटर्न
नमूना योजना (टेम्पलेट)
लक्ष्य/जनसंख्या:...
नमूना बॉक्स: स्रोत, कवर/छेद
चयन की इकाई: उपयोक्ता/सत्र/घटना
डिजाइन: स्ट्रेटा (देश, मंच), शेयर, चयन विधि
आकार (n): गणना, मान्यताएं (×, शक्ति, एमडीई), डेफ
वजन योजना: डिजाइन वजन, स्तरीकरण के बाद (नियंत्रण योग)
कैलेंडर: दिन/घंटा/छुट्टी कवरेज
गुणवत्ता: कवरेज परीक्षण, गैर-जिम्मेदार योजना, संपर्क प्
जोखिम: चयन, हस्तक्षेप, गोपनीयता/पीआईआई
मालिक और नियंत्रण: कौन गिनता है/संग्रह/संस्करण
वजन पासपोर्ट (टेम्पलेट)
आधार वजन: (w_i=1/\pi_i)
अंशांकन: लक्ष्य (देश, मंच, आयु), विधि (रेकिंग), सहिष्णुता
प्रतिबंध: ट्रिमिंग w [ , ]
निदान: ईएसएस, सीवी (डब्ल्यू), एसएमडी से पहले/बाद में
उपयोग: कौन सी रिपोर्ट/मॉडल वजन लागू करते हैं
संस्करण: v1→v2, तिथि, मालिक
14) गोपनीयता और नैतिकता
डिजाइन द्वारा गोपनीयता: क्षेत्र न्यूनतम, एकत्रीकरण, छद्म नाम।
विभेदक गोपनीयता: गोपनीयता प्रवर्धन के रूप में यादृच्छिक/सबसैम्पलिंग।
निष्पक्षता: संवेदनशील विशेषताओं के खिलाफ त्रुटि/वजन अंतर की जाँच करें; समूहों को "अदृश्य" होने की अनुमति न दें।
15) प्री-स्टार्ट चेकलिस्ट
- नमूना बॉक्स का वर्णन किया गया है; कोटिंग छेद की पहचान और प्रलेखित
- चयनित डिजाइन (strata/clusters), गणना (n), Deff, MDE
- डिजाइन भार और अंशांकन योजना सेट करें (नियंत्रण योग सहमत)
- समय खिड़कियां/मौसमी परिभाषित; गैर-जिम्मेदार द्वारा एक योजना है
- सत्यापन विभाजन समय/समूहों पर विचार करते हैं; कोई लीक नहीं
- गुणवत्ता मैट्रिक्स: ईएसएस, एसएमडी, पीएसआई, बूटस्ट्रैप अंतराल
- प्रलेखन और संस्करण; अभिगम अधिकार और गोपनीयता की जांच की गई
मिनी शब्दावली
डेफ: डिजाइन के कारण स्कोर का गुणक बढ़ रहा है।
ईएसएस: वजन के बाद प्रभावी नमूना आकार।
IPS/DR: ऑफ-पॉलिसी/लॉग डेटा के लिए वजन करने के तरीके।
एसएमडी: मानकीकृत औसत अंतर (सहसंयोजक संतुलन)।
जलाशय का नमूना: धारा से एक यादृच्छिक नमूना बनाए रखना।
कुल
प्रतिनिधित्व "नमूने के साथ भाग्यशाली नहीं है", लेकिन एक डिज़ाइन की गई प्रक्रिया: एक सही फ्रेम, विचारशील चयन डिज़ाइन, पर्याप्त आकार, वजन और अंशांकन, ईमानदार विभाजन और कठोर निदान। वर्णित प्रथाओं का पालन करके, आप पूर्वाग्रह को कम करते हैं, निष्कर्षों की पोर्टेबिलिटी बढ़ाते हैं और उत्पाद, विपणन, जोखिम और एमएल के लिए विश्वसनीय समाधान प्राप्त करते हैं।