Samplicação e representatividade
Samplicação e representatividade
O sampleamento é um subconjunto de observação para medições, experiências e aprendizado de modelos. Representatividade significa que as conclusões da amostra são escaladas para a população alvo sem erro sistemático. Abaixo, como projetar uma amostra, avaliar sua qualidade e ajustar os deslocamentos.
1) Conceitos básicos
População: conjunto de alvo (todos os usuários/sessões/transações).
Moldura de amostra (sampling frame): lista/mecanismo do qual realmente selecionamos (é importante identificar revestimentos e «buracos»).
Unidade de seleção: usuário, sessão, evento, transação, dispositivo.
Representatividade: correspondência entre a distribuição de sinais-chave na amostra e na população (com o erro acidental).
vs acidental erro sistemático: dispersão de avaliações contra deslocamento (bias).
2) Tipos de sampleamento
2. 1 Prováveis (preferenciais)
SRS (simples aleatório): probabilidade igual de seleção.
Estraçalhado: dividir a população em estratos (país/canal/plataforma), depois SRS dentro de estratos → menos dispersão e melhor revestimento.
Cluster: seleção de grupos (dias/servidores/lojas); Barato, mas superior à correlação intraclastérica.
Sistemático: cada um dos elementos K após o início acidental (são necessários dados «não incrões»).
PPS (propability propitional to size): probabilidade de ∝ ao tamanho da unidade (por exemplo, volume de tráfego do parceiro).
2. 2 Incríveis (com cuidado)
Facilidades/voluntários: sondagens rápidas, logs clicados → risco de deslocamento seletivo.
Quociente/bola de neve: útil em grupos de nicho, mas precisa de calibragem posterior.
3) Fontes de deslocamento
Revestimento (coverage): parte da população não está na moldura (por exemplo, dados iOS quando o tracking é proibido).
Seleção: o mecanismo de seleção está associado à variável de destino (os ativos são mais frequentes).
Não-Seletiva (nonresponse): Os que não aparecem são sistematicamente diferentes.
Sobreviventes (survivorship): Ignorar os que saíram/bloqueados.
Marcações ruidosas, rótulos proxy, ajustes manuais.
Leeks: utilização de uma futura infa na formação de uma amostra/fic.
4) Tamanho da amostra e potência
4. 1 Aproximações
Para (p) com precisão (e) e confiança (1-\alpha):[
n \approx \frac{z_{\alpha/2}^2, p(1-p)}{e^2}
]
Conservadoramente pegado (p = 0 5). Ajuste para a população final, se necessário.
Para o médio com o conhecido (\sigma):[
n \approx \left(\frac{z_{\alpha/2},\sigma}{e}\right)^2
]
4. 2 Efeito de design e tamanho eficiente
Design Effect: (\mathrm\Deff f. = 1 + (m-1 )\rho), onde (m) o tamanho do cluster e (\rho) a correlação interna.
Tamanho efetivo: (n _\text <eff = n/\mathrm\Deff f.). Designs cluster/ponderado muitas vezes exigem mais (n).
4. 3 A/B e MDE
Para métricas binárias em grupos simétricos:[
n_{\text{на группу}} \approx \frac{2(z_{1-\alpha/2}+z_{1-\beta})^2, \bar{p}(1-\bar{p})}{\mathrm{MDE}^2}
]
O nível básico (\bar, por exemplo), o MDE é um efeito mínimo de detecção.
Leve em conta a sazonalidade e a interferência (spillover), e aplique CUPED/covariates para reduzir a dispersão.
5) Peso e calibragem (fazemos uma amostra «semelhante» à população)
Peso de design: (w _ i = 1/\pi _ i) (probabilidade invertida de seleção).
Pós-ratificação e raking: Ajustamos os marginais ponderados (país/plataforma/meia-idade, etc.) para partes conhecidas.
Calibragem (calibration weighting): Minimize a variação da balança quando corresponder exatamente aos totais de controle.
Butstrap/Replicação: avaliação correta da dispersão na balança.
Diagnóstico: ESS (effectiva sample size), balança de variação (CM, p95/p5), comparação antes/depois em sinais-chave.
6) Classe imbalance e eventos raros
Seleção de meta estraçalhada: oversample classe rara, mas use sempre a correção do limite/balança no aprendizado.
Costa-sensive learning: salmões ponderados em vez de sintéticos.
SMOTE/ADASYN: cuidado - risco de vazamentos/artefatos; mantenha os slits de tempo/grupo rigorosos.
Avaliação: PR-AUC, Recall@FPR≤x%; calibrar as hipóteses.
7) Streaming e grandes dados
Reservoir sampling: mantenha um subconjunto representativo do fluxo de comprimento desconhecido.
Sampling de eventos: proporcional à frequência/importância; para raros, tampões de trigo.
Contadores e desenhos: Bloom/Count-Min para frequência/exclusividade; para analistas - combine com a contagem de precisão periódica.
De-dup e idempotidade: chaves de evento, janelas de dedução.
8) Aspectos do tempo e do espaço
Time-based sampling: janelas fixas (rolling), ponto-in-time correto.
Cluster/geo-sampling: clusterização por nós/região; leve em conta a correção automática do espaço.
Sazonalidade/ritmo: cobertura representativa de horas/dias da semana/feriados.
9) Off-policy/dados de limpeza e causalidade
10) Diagnóstico de representatividade
Comparação de marginais: tabelas de população vs amostra por sinais fundamentais.
O balanço é cobiçado: SMD (standardized mean individuence), Love plots.
Densidade/Quantili: Testes KS, quantile-plots, PSI.
Avaliação do modelo: estabilização das métricas em out-of-time e out-of-domain cortes.
ESS e peso: O ESS baixo indica alta dispersão de notas.
11) Anti-pattern
«Samplim só ativo ontem» → perda de frio/sono.
Média dos juros «média dos segmentos» sem balança.
Misturar os níveis de agregação (eventos e usuários) em uma amostra.
Seleção aleatória após filtros que dependem da meta (seleção on the outcome).
Cross-val sem splits de grupo/tempo para dados dependentes.
Aplicar SMOTE antes de dividir-se em trem/val (fuga).
12) Cenários privados (malas)
Sondagem de jogadores por país/plataforma/idade; pós-ratificação para as participações MAU; Controle de deslocamento nonresponse.
Logi para EDA: sistemático 1: N sample eventos + revestimento completo de tipos raros.
Detecção de frod: target de rateio, lossos de custo-sensível, avaliação para PR-AUC e Recall@FPR≤x%.
A/B com tráfego limitado: computação MDE, extensão com regras power, CUPED.
Avaliação de promoção off-policy: iPS/DR. com limite de balança (trimming), verificação de sobreposição de suporte.
13) Modelos de artefatos
Plano de sampleamento (template)
Alvo/população:...
Moldura de amostra: fontes, revestimentos/buracos
Unidade de seleção: usuário/sessão/evento
Design: Estrações (country, platformm), participações, modo de seleção
Tamanho (n): cálculo, suposições ( , power, MDE), Deff
Padrão de peso: peso de design, pós-rateio (total de controle)
Calendário: cobertura de dias/horas/feriados
Qualidade: testes de revestimento, plano de linresponse, procedimentos de contato
Riscos: seleção, interferência, privacidade/PII
Proprietários e controle: quem pensa/guarda/versioniza
Passaporte de pesagem (template)
Pesos básicos: (w _ i = 1/\pi _ i)
Calibrar: alvos (country, platformm, age), método (raking), tolerância
Limitações: trimming w ∈ [w _ min, w _ max]
Diagnóstico: ESS, CM (w), SMD antes/depois
Uso: quais relatórios/modelos aplicam peso
Versões: v1→v2, data, proprietários
14) Privacidade e ética
Private by Design: Minimizar campos, agregações, pseudônimos.
Privacidade diferencial: randomização/subsamplicação como aumento da privacidade (privacidade).
Justiça: verifique a diferença de erro/balança por atributos sensíveis; Não permita a invisibilidade de grupos.
15) Folha de cheque antes de iniciar
- O quadro da amostra está descrito; detetado e documentado «buracos» de revestimento
- Design selecionado (stratos/clusters), calculado (n), Deff, MDE
- Configuração de peso de design e plano de calibragem (totais de controle acordados)
- As janelas temporárias/sazonalidade foram definidas; há um plano por nonresponse
- Os slits de validação consideram o tempo/grupo; sem vazamentos
- Métricas de qualidade: ESS, SMD, PSI, espaçamento de bottrap
- Documentação e versões; permissões e contornos de privacidade testados
Mini-glossário
Deff: multiplicador que aumenta a dispersão das notas devido ao design.
ESS: tamanho de amostra eficaz após a pesagem.
IPS/DR.: Métodos de ponderação para dados off-policy/boat.
SMD: diferença de média normalizada (saldo de cobiçados).
Reservoir sampling - manter sample aleatório do fluxo.
Resultado
Representatividade não é «sorte com o sample», mas um processo projetado: moldura correta, design de seleção elaborado, tamanho suficiente, pesagem e calibragem, slits justos e diagnóstico rigoroso. Seguindo as práticas descritas, você reduz o deslocamento, aumenta a portabilidade das conclusões e obtém soluções confiáveis para o produto, marketing, risco e ML.