샘플링과 표현
샘플링과 표현
샘플링은 측정, 실험 및 모델 훈련을위한 일련의 관측 집합을 선택하는 것입니다. 대표성은 샘플의 결론이 편견없이 목표 모집단으로 확장됨을 의미합니다. 다음은 샘플을 설계하고 품질을 평가하며 오프셋을 수정하는 방법입니다.
1) 기본 개념
인구: 대상 객체 세트 (모든 사용자/세션/트랜잭션).
샘플링 프레임: 실제로 선택한 목록/메커니즘 (코팅 및 "구멍" 을 식별하는 것이 중요합니다).
선택 단위: 사용자, 세션, 이벤트, 거래, 장치.
대표 성: 샘플 및 모집단의 주요 속성 분포를 일치시킵니다 (무작위 오차 허용 오차 포함).
랜덤 대 바이어스: 추정치 대 바이어스 (바이어스) 의 분산.
2) 샘플링의 종류
2. 1 확률 (선호)
SRS (간단한 무작위): 동일한 선택 확률.
계층화: 계층화 된 인구 (국가/채널/플랫폼), 계층 내 SRS → 더 낮은 분산 및 더 나은 적용 범위.
클러스터: 그룹 선택 (일/서버/상점); 저렴하지만 더 높은 계층 내 상관 관계.
체계적인: 무작위 시작 후 모든 kth 요소 ("비동기" 데이터 필요).
PPS (크기에 비례하는 확률) - 확률은 단위 크기 (예: 파트너 트래픽 볼륨) 입니다.
2. 2 놀라운 (주의 사항)
편의 시설/자원 봉사자: 빠른 설문 조사, "클릭" 로그 → 선택 편향의 위험.
쿼터/스노우 볼: 틈새 그룹에 유용하지만 후속 교정이 필요합니다.
3) 변위 원
적용 범위: 모집단의 일부가 프레임에 없습니다 (예: 추적 할 때 iOS 데이터가 금지 됨).
선택: 선택 메커니즘은 대상 변수와 관련이 있습니다 (활성 낙하).
비 응답: 응답하지 않는 것은 체계적으로 다릅니다.
생존자: 출발/차단 무시.
오프셋 라벨: 시끄러운 태그, 프록시 라벨, "수동" 조정.
얼굴: 샘플/기능의 형성에 미래 정보의 사용.
4) 샘플 크기와 힘
4. 1 근사
정밀도 (e) 및 신뢰 (1-\알파) 를 가진 분수 (p) 의 경우:[
n\axx\frac {z _ {\alpha/2} ² 2, p (1-p)} {e ² 2}
]
우리는 보수적으로 받아들입니다 (p = 0 {.} 5). 필요한 경우 최종 인구를 조정하십시오.
알려진 매체의 경우 (\sigma):[
n\axx\왼쪽 (\frac {z _ {\alpha/2} ,\sigma} {e }\right) ² 2
]
4. 2 디자인 효과 및 유효 크기
디자인 효과: (\mathrm {Deff} = 1 + (m-1 )\rho), 여기서 (m) 은 클러스터 크기이고 (\rho) 는 클러스터 내 상관 관계입니다.
유효 크기: (n _\텍스트 {eff} = n/\mathrm {Deff}). 클러스터/가중 디자인에는 종종 더 많은 (n) 이 필요합니다.
4. 3 A/B 및 MDE
대칭 그룹이있는 이진 메트릭의 경우:[
n _ {\텍스트 {не
]
여기서 (\bar {p}) 는 기본 레벨이고 MDE는 최소 감지 가능한 효과입니다.
계절성 및 간섭 (유출) 을 고려하고 분산을 줄이기 위해 CUPED/공변량을 적용하십시오.
5) 무게 및 교정 (모집단과 "유사" 샘플)
디자인 가중치: (w _ i = 1/\pi _ i) (역 선택 확률).
계층화 및 긁힘: 가중 한계 (국가/플랫폼/성별 연령 등) 를 알려진 분수로 조정합니다.
교정 가중치: 제어 총계와 정확히 일치 할 때 가중치의 편차를 최소화합니다.
부트 스트랩/복제: 가중치에서의 차이의 정확한 추정.
진단: 주요 기능에 의한 비교 전/후 ESS (유효 샘플 크기), 무게 확산 (CV, p95/p5).
6) 클래스 불균형 및 드문 사건
목표에 의한 계층화 된 선택: 오버 샘플은 드문 클래스이지만 훈련에서 항상 임계 값/무게 조정을 사용합니다.
비용에 민감한 학습: 합성 대신 가중 손실.
SMOTE/ADASYN: 주의-누출/아티팩트의 위험; 엄격한 시간/그룹 분할을 유지하십시오.
등급: PR-AUC, 리콜 @ FPR 확률 보정.
7) 스트리밍 및 빅 데이터
저수지 샘플링: 알 수없는 길이의 스트림에서 대표 하위 집합을 유지하십시오.
이벤트 샘플링: 빈도/중요도에 비례; 드문 경우-트리거 버퍼.
카운터 및 스케치: 주파수/독창성을위한 Bloom/Count-Min; 분석을 위해-주기적으로 정확한 계산과 결합하십시
이벤트 키, 중복 제거 창.
8) 시간적 및 공간적 측면
시간 기반 샘플링: 고정 창 (롤링), 시점 정확성.
클러스터/지리 샘플링: 노드/지역별 클러스터링; 공간적 자기 상관을 고려하십시오.
계절성/리듬: 요일/공휴일의 대표적인 범위.
9) 비 정책/로그 데이터 및 인과 관계
10) 대표 진단
한계 비교: 주요 속성별로 테이블 모집단 대 샘플.
공변량의 균형: SMD (표준화 된 평균 차이), 사랑 플롯.
밀도/정량: KS 테스트, 양자 도표, PSI.
모델 자격: 시간 외 및 도메인 외 슬라이스에서 메트릭의 안정화.
ESS 및 가중치: 낮은 ESS는 점수의 높은 차이를 나타냅니다.
11) 반 패턴
"어제 활성 샘플" → 감기/침목 손실.
가중치가없는 평균 백분율 "세그먼트 평균".
하나의 샘플에서 집계 수준 (이벤트 및 사용자) 을 혼합하십시오.
대상 종속 필터 후 임의 선택 (결과에 대한 선택).
그룹/시간이없는 크로스 발은 종속 데이터로 나뉩니다.
기차/발 (누출) 전에 SMOTE를 적용하십시오.
12) 개인 시나리오 (사례)
플레이어 설문 조사: 국가/플랫폼/연령별로 계층화; MAU 주식에 대한 계층화 후; 비 응답 상쇄 제어.
EDA 로그: 체계적인 1: N 이벤트 샘플 + 희귀 유형의 전체 범위.
사기 탐지: 대상 계층화, 비용에 민감한 손실, PR-AUC 점수 및 리콜 @ FPR
트래픽이 제한된 A/B: MDE 계산, 전력 규칙 갱신, CUPED.
정책 외 평가 프로모션: 무게 제한 (트리밍) 이있는 IPS/DR, 중복 점검 지원.
13) 아티팩트 패턴
샘플링 계획 (템플릿)
대상/인구:...
샘플링 박스: 소스, 커버/홀
선택 단위: 사용자/세션/이벤트
디자인: 지층 (국가, 플랫폼), 공유, 선택 방법
크기 (n): 계산, 가정 (α, 전력, MDE), Deff
체중 계획: 설계 가중치, 계층화 후 (제어 총계)
일정: 일/시간/휴일 범위
품질: 적용 범위 테스트, 비 응답 계획, 연락처 절차
위험: 선택, 간섭, 개인 정보 보호/PII
소유자 및 제어: 계산/상점/버전
무게 측정 여권 (템플릿)
기초 가중치: (w _ i = 1/\pi _ i)
교정: 목표 (국가, 플랫폼, 연령), 방법 (레이킹), 공차
제한 사항: w [w _ min, w _ max] 트리밍
진단: ESS, CV (w), SMD 전/후
사용: 보고서/모델이 가중치를 적용하는 것
버전: v1 → v2, 날짜, 소유자
14) 개인 정보 보호 및 윤리
디자인 별 개인 정보 보호: 필드 최소화, 집계, 가명.
차등 프라이버시: 프라이버시 증폭으로 무작위/서브 샘플링.
공정성: 민감한 속성에 대한 오류/무게 차이를 확인하십시오. 그룹이 "보이지 않는" 것을 허용하지 않습니다.
15) 사전 시작 체크리스트
- 샘플링 박스가 설명되어 있습니다. 식별 및 문서화 된 코팅 구멍
- 선택된 디자인 (스트라타/클러스터), 계산 (n), Deff, MDE
- 설계 가중치 및 교정 계획 설정 (제어 합계 합의)
- 시간 창/계절성 정의; 비 응답에 의한 계획이 있습니다
- 검증 분할은 시간/그룹을 고려합니다. 누출 없음
- 품질 지표: ESS, SMD, PSI, 부트 스트랩 간격
- 문서 및 버전; 액세스 권한 및 개인 정보 윤곽 확인
미니 용어집
Deff: 승수는 디자인으로 인한 점수의 분산을 증가시킵니다.
ESS: 가중 후 효과적인 샘플 크기.
IPS/DR: 비 정책/로그 데이터에 대한 가중 방법.
SMD: 표준화 된 평균 차이 (공변량 균형).
저수지 샘플링: 스트림에서 임의의 샘플을 유지합니다.
합계
대표성은 "샘플에 운이 좋지 않다" 가 아니라 올바른 프레임, 신중한 선택 디자인, 충분한 크기, 계량 및 교정, 정직한 분할 및 엄격한 진단과 같은 설계된 프로세스입니다. 설명 된 관행을 따르면 편견을 줄이고 결론의 이식성을 높이며 제품, 마케팅, 위험 및 ML에 대한 신뢰할 수있는 솔루션을 얻을 수 있습니다.