Teste A/B Errado Custa Caro: Como Fazer Certo com Estatística Você está olhando para os resultados do seu Teste A/B: Variação A: 52% de conversão Variação B: 54% de conversão "B venceu! Vamos implementar em 100% do tráfego." Dois meses depois, você descobre que não funcionou. A conversão volta para 50%. Você gastou meses e perdeu oportunidade. Sabe por quê? Você violou uma regra fundamental da estatística: não confunda flutuação aleatória com efeito real. Este artigo te ensina como fazer Teste A/B do jeito certo — e quando realmente há diferença estatística. O Erro Mais Comum: Parar Muito Cedo Imagine este cenário comum: Você começa um Teste A/B com 100 pessoas. A: 50 convertidas = 50% B: 54 convertidas = 54% "B está 4 pontos percentuais à frente! Vamos parar de testar e implementar!" Só que com apenas 100 pessoas, a margem de erro é gigantesca. Você pode estar vendo ruído, não efeito real. Intervalo de confiança (95%) para esse teste: A: 50% ± 10% (intervalo: 40% a 60%) B: 54% ± 9% (intervalo: 45% a 63%) Os intervalos se sobrepõem completamente. Não há diferença estatística. Mas você implementou B de qualquer forma. Resultado? Quando você testa com 10.000 pessoas (amostra maior), a verdade aparece: A: 50% ± 1.5% (intervalo real: 48.5% a 51.5%) B: 50.5% ± 1.5% (intervalo real: 49% a 52%) Não há diferença. Você estava vendo ruído. A Metodologia Correta: Power Analysis Antes de iniciar um Teste A/B, você deve calcular o tamanho de amostra necessário (power analysis). A fórmula depende de: 1. Tamanho do efeito esperado: qual é a diferença mínima que importa? 2. Nível de significância (α): 5% é padrão (95% confiança) 3. Power (1-β): geralmente 80% (aceitar 20% de chance de não detectar efeito real) Exemplo prático: Cenário: Você quer testar um CTA novo que espera converter 2% melhor que o atual (de 50% para 52%). Com power analysis, você precisa de ~6.500 pessoas por variação (total: 13.000) para detectar essa diferença com 80% de confiança. Se você parar com 100 pessoas, está "underpowered" — sua chance de detectar uma diferença real é só ~10%. Checklist: Fazendo Teste A/B Certo 1. Antes de Começar o Teste 2. Durante o Teste 3. Depois que Terminou Exemplo: Intervalo de Confiança vs P-Value Muitos analistas usam p-value para decidir. Grande erro. P-value te diz: "Se a hipótese nula fosse verdadeira, qual a chance de ver esses dados?" Intervalo de confiança te diz: "Qual é o intervalo onde o efeito real provavelmente está?" Vamos ao exemplo: Casos Reais: Quando o Teste Enganou Caso 1: E-commerce (teste de cor de botão) Uma loja testou dois CTAs: A (botão azul): 2.5% de conversão (n=5.000) B (botão verde): 2.7% de conversão (n=5.000) "Verde venceu! Implementar em 100%." Três semanas depois, a taxa voltou para 2.5% em ambos. Por quê? Intervalo de confiança real: A: 2.5% ± 0.3% B: 2.7% ± 0.3% Overlap quase total. Era ruído, não efeito real. Moraleja: para detectar uma diferença de 0.2% com confiança, você precisa de ~100.000 pessoas, não 5.000. Caso 2: SaaS (teste de pricing) Teste de plano de preço: A (R$99/mês): 5% conversão B (R$79/mês): 7% conversão "B converteu mais! Vamos abaixar o preço!" Mas: Revenue A: R$ 99 × 5% = R$ 4.95 por visitante Revenue B: R$ 79 × 7% = R$ 5.53 por visitante Parece que B é melhor. Mas o intervalo de confiança para revenue: A revenue: R$ 4.95 ± R$ 1.20 B revenue: R$ 5.53 ± R$ 1.30 Overlap massivo. Não sabemos de verdade qual é melhor. Quando Parar de Testar Pare quando: ✅ Seus intervalos de confiança NÃO se sobrepõem (evidência de diferença real) ✅ Você atingiu seu N pré-calculado (com power analysis) E os intervalos se sobrepõem (não há diferença) ✅ Seu intervalo é tão estreito que a diferença não importa (ex: 50.4% vs 50.6% — diferença muito pequena) Não pare quando: ❌ "A é melhor agora, vamos implementar" ❌ Você rodou N testes de hipótese ("tivemos 20 testes, um com p < 0.05 por acaso") ❌ Você olhou no meio e gostou de um resultado Fórmula Prática: Calculando Intervalo de Confiança Se você quer calcular sem software: Exemplo: Taxa: 50% conversão Amostra: 100 pessoas Intervalo = 0.50 ± 1.96 × √(0.50 × 0.50 / 100) Intervalo = 0.50 ± 1.96 × 0.05 Intervalo = 0.50 ± 0.098 Intervalo: 40.2% a 59.8% (gigantesco!) Com 10.000 pessoas: Intervalo = 0.50 ± 1.96 × √(0.50 × 0.50 / 10.000) Intervalo = 0.50 ± 0.0098 Intervalo: 49% a 51% (bem apertado) Maior amostra = intervalo mais estreito = conclusão mais confiável. Ferramentas para Teste A/B Se não quer calcular na mão: ABTestGuide.com: calculadora de poder de teste Optimizely: plataforma com cálculos integrados VWO (Visual Website Optimizer): design com estatística embutida Python (scipy.stats): para testes Conclusão: O Erro Que Custa Oportunidade A maioria das empresas comete este erro: 1. Começa teste A/B 2. Vê B "ganhando" no dia 3 3. Implementa B em 100% do tráfego 4. Descobre que era ruído 5. Perde 2 meses testando A solução é simples: ✅ Calcule tamanho de amostra a