5 Funções Pandas para Limpeza de Dados Limpeza de dados consome 60-80% do tempo de um analista. Mas a maioria não usa as funções certas do Pandas para automatizar esse processo. Neste post, vou mostrar as 5 funções que fazem diferença real — cada uma resolve um tipo diferente de dado sujo. 1. com Strategy por Coluna O problema: valores faltantes (NaN) que quebram análises inteiras. A maioria dos analistas usa ou — aplicando a mesma estratégia para tudo. A solução correta: Por que funciona: Cada coluna tem distribuição diferente. Preencher preço com mediana preserva a distribuição. Preencher categoria com valor padrão mantém semântica. Dados de tempo recebem timestamp atual, não zero. Resultado: Datasets equilibrados, sem distorção de distribuição. 2. com Subset Específico O problema: linhas duplicadas que você não percebe — porque podem estar duplicadas só em colunas importantes. A maioria usa — remove duplicação total apenas. A solução: Por que funciona: Nem sempre uma linha inteira é duplicada. Um mesmo usuário pode ter 2 compras no mesmo dia com dados ligeiramente diferentes. O subset diz exatamente o que define "duplicação" no contexto do seu negócio. Resultado: Remoção precisa de duplicação, sem perder linhas válidas. 3. + em Lote O problema: espaços em branco e inconsistência de case que quebram joins e agrupamentos. Por que funciona: "CATEGORIA " (com espaço) não é igual a "categoria". "Eletrônicos" != "eletronicos". Quando você agrupa ou faz join depois, essas pequenas diferenças criam grupos fantasma. Resultado: Normalização de texto em lote, sem loop manual. 4. com O problema: datas em formatos inconsistentes que causam erro ao converter. A maioria tenta: A solução: Por que funciona: transforma valores não-conversíveis em NaT (Not a Time), deixando o resto da análise continuar. Você pode investigar depois qual linha tem problema. Resultado: Conversão de tipos sem parar o pipeline. 5. no Lugar de Múltiplos Filtros Booleanos O problema: múltiplos filtros encadeados são lentos e difíceis de ler. Ruim: Melhor: Por que funciona: é mais rápido (usa compilação interna) e muito mais legível. A lógica fica em formato SQL-like, que é familiar para analistas. Resultado: Código 30% mais rápido e muito mais legível. Colocando Tudo Junto Aqui está um pipeline completo usando essas 5 funções: Impacto Real Essa sequência resolve: ✅ Valores faltantes sem distorcer distribuição ✅ Duplicação de negócio removida precisamente ✅ Texto normalizado para agrupamentos corretos ✅ Datas válidas sem quebra do pipeline ✅ Filtros legíveis e rápidos Cada uma dessas funções economiza horas de script manual ou Excel. Juntas? Você automatiza o que levaria 8 horas em 30 minutos de código. A limpeza de dados não é o trabalho sexy de um analista — mas é o que decide se sua análise é confiável. Domine essas 5 funções e você já está em 80% dos casos reais. Aprenda mais sobre análise de dados profissional na Elite Data Academy — Python, SQL, Power BI e muito mais com projetos do mercado real.