Logo GH

Samplicação e representatividade

Samplicação e representatividade

O sampleamento é um subconjunto de observação para medições, experiências e aprendizado de modelos. Representatividade significa que as conclusões da amostra são escaladas para a população alvo sem erro sistemático. Abaixo, como projetar uma amostra, avaliar sua qualidade e ajustar os deslocamentos.

1) Conceitos básicos

População: conjunto de alvo (todos os usuários/sessões/transações).
Moldura de amostra (sampling frame): lista/mecanismo do qual realmente selecionamos (é importante identificar revestimentos e «buracos»).
Unidade de seleção: usuário, sessão, evento, transação, dispositivo.
Representatividade: correspondência entre a distribuição de sinais-chave na amostra e na população (com o erro acidental).
vs acidental erro sistemático: dispersão de avaliações contra deslocamento (bias).

2) Tipos de sampleamento

2. 1 Prováveis (preferenciais)

SRS (simples aleatório): probabilidade igual de seleção.
Estraçalhado: dividir a população em estratos (país/canal/plataforma), depois SRS dentro de estratos → menos dispersão e melhor revestimento.
Cluster: seleção de grupos (dias/servidores/lojas); Barato, mas superior à correlação intraclastérica.
Sistemático: cada um dos elementos K após o início acidental (são necessários dados «não incrões»).
PPS (propability propitional to size): probabilidade de ∝ ao tamanho da unidade (por exemplo, volume de tráfego do parceiro).

2. 2 Incríveis (com cuidado)

Facilidades/voluntários: sondagens rápidas, logs clicados → risco de deslocamento seletivo.
Quociente/bola de neve: útil em grupos de nicho, mas precisa de calibragem posterior.

3) Fontes de deslocamento

Revestimento (coverage): parte da população não está na moldura (por exemplo, dados iOS quando o tracking é proibido).
Seleção: o mecanismo de seleção está associado à variável de destino (os ativos são mais frequentes).
Não-Seletiva (nonresponse): Os que não aparecem são sistematicamente diferentes.
Sobreviventes (survivorship): Ignorar os que saíram/bloqueados.
Marcações ruidosas, rótulos proxy, ajustes manuais.
Leeks: utilização de uma futura infa na formação de uma amostra/fic.

4) Tamanho da amostra e potência

4. 1 Aproximações

Para (p) com precisão (e) e confiança (1-\alpha):
[
n \approx \frac{z_{\alpha/2}^2, p(1-p)}{e^2}
]

Conservadoramente pegado (p = 0 5). Ajuste para a população final, se necessário.

Para o médio com o conhecido (\sigma):
[
n \approx \left(\frac{z_{\alpha/2},\sigma}{e}\right)^2
]

4. 2 Efeito de design e tamanho eficiente

Design Effect: (\mathrm\Deff f. = 1 + (m-1 )\rho), onde (m) o tamanho do cluster e (\rho) a correlação interna.
Tamanho efetivo: (n _\text <eff = n/\mathrm\Deff f.). Designs cluster/ponderado muitas vezes exigem mais (n).

4. 3 A/B e MDE

Para métricas binárias em grupos simétricos:
[
n_{\text{на группу}} \approx \frac{2(z_{1-\alpha/2}+z_{1-\beta})^2, \bar{p}(1-\bar{p})}{\mathrm{MDE}^2}
]

O nível básico (\bar, por exemplo), o MDE é um efeito mínimo de detecção.
Leve em conta a sazonalidade e a interferência (spillover), e aplique CUPED/covariates para reduzir a dispersão.

5) Peso e calibragem (fazemos uma amostra «semelhante» à população)

Peso de design: (w _ i = 1/\pi _ i) (probabilidade invertida de seleção).
Pós-ratificação e raking: Ajustamos os marginais ponderados (país/plataforma/meia-idade, etc.) para partes conhecidas.
Calibragem (calibration weighting): Minimize a variação da balança quando corresponder exatamente aos totais de controle.
Butstrap/Replicação: avaliação correta da dispersão na balança.
Diagnóstico: ESS (effectiva sample size), balança de variação (CM, p95/p5), comparação antes/depois em sinais-chave.

6) Classe imbalance e eventos raros

Seleção de meta estraçalhada: oversample classe rara, mas use sempre a correção do limite/balança no aprendizado.
Costa-sensive learning: salmões ponderados em vez de sintéticos.
SMOTE/ADASYN: cuidado - risco de vazamentos/artefatos; mantenha os slits de tempo/grupo rigorosos.
Avaliação: PR-AUC, Recall@FPR≤x%; calibrar as hipóteses.

7) Streaming e grandes dados

Reservoir sampling: mantenha um subconjunto representativo do fluxo de comprimento desconhecido.
Sampling de eventos: proporcional à frequência/importância; para raros, tampões de trigo.
Contadores e desenhos: Bloom/Count-Min para frequência/exclusividade; para analistas - combine com a contagem de precisão periódica.
De-dup e idempotidade: chaves de evento, janelas de dedução.

8) Aspectos do tempo e do espaço

Time-based sampling: janelas fixas (rolling), ponto-in-time correto.
Cluster/geo-sampling: clusterização por nós/região; leve em conta a correção automática do espaço.
Sazonalidade/ritmo: cobertura representativa de horas/dias da semana/feriados.

9) Off-policy/dados de limpeza e causalidade

IPS (inverse propensity): (w_i=1/\pi(a_ix _ i)) para correção de logs-sample para a nova política.
Avaliações Dr. Duply Robust para reduzir deslocamento e dispersão.
Transportabilidade: transferência de resultados entre mercados/canais - verifique a correspondência do cobiçado (covariate shift).
O Label shift: (P (y)) muda quando estável (P (x)y)); use o M/recalibrado.

10) Diagnóstico de representatividade

Comparação de marginais: tabelas de população vs amostra por sinais fundamentais.
O balanço é cobiçado: SMD (standardized mean individuence), Love plots.
Densidade/Quantili: Testes KS, quantile-plots, PSI.
Avaliação do modelo: estabilização das métricas em out-of-time e out-of-domain cortes.
ESS e peso: O ESS baixo indica alta dispersão de notas.

11) Anti-pattern

«Samplim só ativo ontem» → perda de frio/sono.
Média dos juros «média dos segmentos» sem balança.
Misturar os níveis de agregação (eventos e usuários) em uma amostra.
Seleção aleatória após filtros que dependem da meta (seleção on the outcome).
Cross-val sem splits de grupo/tempo para dados dependentes.
Aplicar SMOTE antes de dividir-se em trem/val (fuga).

12) Cenários privados (malas)

Sondagem de jogadores por país/plataforma/idade; pós-ratificação para as participações MAU; Controle de deslocamento nonresponse.
Logi para EDA: sistemático 1: N sample eventos + revestimento completo de tipos raros.
Detecção de frod: target de rateio, lossos de custo-sensível, avaliação para PR-AUC e Recall@FPR≤x%.
A/B com tráfego limitado: computação MDE, extensão com regras power, CUPED.
Avaliação de promoção off-policy: iPS/DR. com limite de balança (trimming), verificação de sobreposição de suporte.

13) Modelos de artefatos

Plano de sampleamento (template)

Alvo/população:...

Moldura de amostra: fontes, revestimentos/buracos

Unidade de seleção: usuário/sessão/evento

Design: Estrações (country, platformm), participações, modo de seleção

Tamanho (n): cálculo, suposições ( , power, MDE), Deff

Padrão de peso: peso de design, pós-rateio (total de controle)

Calendário: cobertura de dias/horas/feriados

Qualidade: testes de revestimento, plano de linresponse, procedimentos de contato

Riscos: seleção, interferência, privacidade/PII

Proprietários e controle: quem pensa/guarda/versioniza

Passaporte de pesagem (template)

Pesos básicos: (w _ i = 1/\pi _ i)

Calibrar: alvos (country, platformm, age), método (raking), tolerância

Limitações: trimming w ∈ [w _ min, w _ max]

Diagnóstico: ESS, CM (w), SMD antes/depois

Uso: quais relatórios/modelos aplicam peso

Versões: v1→v2, data, proprietários

14) Privacidade e ética

Private by Design: Minimizar campos, agregações, pseudônimos.
Privacidade diferencial: randomização/subsamplicação como aumento da privacidade (privacidade).
Justiça: verifique a diferença de erro/balança por atributos sensíveis; Não permita a invisibilidade de grupos.

15) Folha de cheque antes de iniciar

  • O quadro da amostra está descrito; detetado e documentado «buracos» de revestimento
  • Design selecionado (stratos/clusters), calculado (n), Deff, MDE
  • Configuração de peso de design e plano de calibragem (totais de controle acordados)
  • As janelas temporárias/sazonalidade foram definidas; há um plano por nonresponse
  • Os slits de validação consideram o tempo/grupo; sem vazamentos
  • Métricas de qualidade: ESS, SMD, PSI, espaçamento de bottrap
  • Documentação e versões; permissões e contornos de privacidade testados

Mini-glossário

Deff: multiplicador que aumenta a dispersão das notas devido ao design.
ESS: tamanho de amostra eficaz após a pesagem.
IPS/DR.: Métodos de ponderação para dados off-policy/boat.
SMD: diferença de média normalizada (saldo de cobiçados).
Reservoir sampling - manter sample aleatório do fluxo.

Resultado

Representatividade não é «sorte com o sample», mas um processo projetado: moldura correta, design de seleção elaborado, tamanho suficiente, pesagem e calibragem, slits justos e diagnóstico rigoroso. Seguindo as práticas descritas, você reduz o deslocamento, aumenta a portabilidade das conclusões e obtém soluções confiáveis para o produto, marketing, risco e ML.

Contact

Entrar em contacto

Contacte-nos para qualquer questão ou necessidade de apoio.Estamos sempre prontos para ajudar!

Telegram
@Gamble_GC
Iniciar integração

O Email é obrigatório. Telegram ou WhatsApp — opcionais.

O seu nome opcional
Email opcional
Assunto opcional
Mensagem opcional
Telegram opcional
@
Se indicar Telegram — responderemos também por lá.
WhatsApp opcional
Formato: +indicativo e número (ex.: +351XXXXXXXXX).

Ao clicar, concorda com o tratamento dos seus dados.