P-value < 0.05 Não Significa o Que Você Pensa (e Custa Dinheiro) A cena é comum em qualquer time de dados: Você rodar um teste A/B. Seu p-value volta como 0.04. Você corre para apresentar ao time de negócio: "Resultado é estatisticamente significante! Vamos implementar." Parece óbvio, certo? Errado. P-value < 0.05 NÃO significa "este resultado é verdadeiro" ou "vamos ganhar dinheiro com isso". Significa algo bem mais específico — e muito menos útil para decisões de negócio. Vamos entender por quê. O Que P-value Realmente Significa A definição oficial: P-value é a probabilidade de observar este resultado (ou mais extremo) SE a hipótese nula fosse verdadeira. Traduzindo para português simples: P-value < 0.05 significa: "Se nada mudasse (hipótese nula), haveria menos de 5% de chance de vermos esses números por acaso." Percebeu a diferença? ❌ Interpretação errada: "Temos 95% de certeza de que o resultado é real" ✅ Interpretação correta: "Se nada mudasse, teríamos <5% de chance de ver isso por acaso" São frases diferentes. E têm implicações completamente diferentes. Por Que A Diferença Importa Vamos com um exemplo concreto. Cenário: Você testa um novo copy em um e-mail marketing. Versão A (original): 100 pessoas abrem, 20 clicam = taxa 20% Versão B (novo copy): 100 pessoas abrem, 25 clicam = taxa 25% Você rodar um teste de proporção. P-value = 0.04. "Significante! Vamos rodar versão B em produção!" você grita. Mas espera. Se o verdadeiro cenário for que ambas as versões têm 20% de taxa de clique naturalmente: Qual é a probabilidade de você ver 25 cliques em 100 tentativas? Resposta: ~4% (por acaso, sem mudança real) Então quando você vê p-value 0.04, significa: "Se nada mudasse, teríamos 4% de chance de ver esse resultado." Mas aqui está o problema: você não sabe se nada mudou ou não. O p-value não te diz a probabilidade de "nada mudou". Ele te diz a probabilidade de "veríamos esses dados SE nada tivesse mudado". São inversas uma da outra. O Problema Real: P-hacking Agora vamos ver por que p-value errado custa MUITO dinheiro. Você trabalha numa empresa de SaaS. Testa 50 variações diferentes de landing page: 1. Mudança de headline 2. Mudança de cor do botão 3. Mudança de posição de CTA 4. Mudança de tamanho de fonte 5. ... (46 variações mais) Você rodar teste em cada uma (50 testes independentes). Com p-value 0.05, estatisticamente: 2-3 desses testes vão dar significante APENAS POR ACASO Mas qual é o resultado? Você implementa os 50 testes. Os 47 que eram reais funcionam OK. Mas os 2-3 que eram "positivos por acaso"? Implementa aquela "otimização" e vê conversão cair. Você perdeu semanas e dinheiro em otimizações que eram apenas ruído estatístico. Isso se chama P-hacking ou múltiplas comparações, e é um problema MASSIVO em análise de dados. Como Usar P-value Corretamente Se p-value não é a resposta para "será que funciona?", qual é? Você precisa fazer 3 perguntas antes de qualquer implementação: 1. Qual era o tamanho da amostra? Teste com 50 pessoas? Resultado pode ser ruído. Teste com 5.000 pessoas? Padrão mais real. Quanto maior a amostra, mais confiável é o resultado. 2. Quantas hipóteses você testou? Quando você testa múltiplas variáveis, o p-value 0.05 não é mais válido. Exemplo real de quando isso saiu errado: Uma empresa testava 30 variações diferentes de copy. Um pesquisador achava "significante" qualquer um com p < 0.05. Com 30 testes: Esperado por acaso: ~1-2 resultados "significantes" Observado: 2 resultados "significantes" Puro acaso. Implementaram e perdeu dinheiro. A solução: Usar Bonferroni correction. Se você testa 30 hipóteses, seu limiar não é 0.05, é 0.05/30 = 0.0017. 3. O resultado faz sentido no mundo real? Essa é a mais importante. Você testa mudança de headline. P-value 0.03. Conversão sobe 0.1%. Estatisticamente significante? Sim. Comercialmente relevante? Provavelmente não. Uma mudança de 0.1% em conversão é: Difícil de reproduzir Dentro da margem de erro de medição Pode evaporar na próxima semana Regra de ouro: Sempre combine p-value com tamanho de efeito (effect size). Não importa que p < 0.05 se o efeito é minúsculo. O Método Correto para Tomar Decisões Em vez de confiar apenas em p-value, use esse checklist: Se 5 ou 6 forem "sim", aí implementa. Se só p-value for "sim", espera mais. Caso Real: Quando P-value Errado Custou Caro Um cliente nosso testa um "novo algoritmo de recomendação" no seu app. A(lgo original) vs B (novo algo): Taxa de engajamento subiu de 5% para 5.3% P-value: 0.045 Implementaram em produção. Time de produto comemorou. 3 meses depois: Engajamento estava de volta em 5% Resultado tinha "voltado ao normal" Por quê? O algoritmo B era mais complicado (mais lento de rodar). O resultado "significante" era um artefato de como os dados foram coletados naquele dia, não um padrão real. Além disso: ninguém tinha verificado se a base de usuários era igual. Se tinha sazonalidade. Se tinha diferença por dispositivo