Data Lake vs Data Warehouse — Por Que Começar com Warehouse (Não Lake) Você quer começar a centralizar dados da empresa. Faz sentido: hoje os dados estão em 10 sistemas diferentes. Relatórios são feitos manualmente. Analistas perdem horas buscando informações. Então alguém sugere: "Vamos montar um data lake!" 6 meses depois, você tem 15TB de dados desorganizados, ninguém consegue fazer query, e o projeto está congelado. Isso é chamado data swamp — e é o erro mais comum (e caro) em data strategy. A Confusão Que Leva A Desastres Você provavelmente já ouviu: > "Data Lake é bom porque você joga tudo lá e organiza depois." Metade verdade = armadilha total. A realidade é: Data Warehouse: dados já organizados, schema definido, pronto para query Data Lake: dados brutos, sem schema, espera-se que alguém organize depois O problema: "depois" nunca chega. O Cenário Real Que Acontece Todo Dia Mês 1: Entusiasmo Mês 2-3: Realidade Mês 4-5: Caos Mês 6: Congelamento A Diferença Que Importa Data Warehouse — O Caminho Correto (Comece Aqui) Características: ✅ Schema: definido ANTES de armazenar ✅ Documentação: obrigatória desde o dia 1 ✅ Qualidade: validações em tempo de entrada ✅ Query speed: rápido (dados estão prontos) Exemplo: PostgreSQL, BigQuery, Snowflake com tabelas estruturadas. Fluxo: 1. Dados chegam (CSV, API, banco origem) 2. Você define: quais colunas? quais tipos? 3. Validação automática (rejeita dados que não match schema) 4. Dados armazenados (já limpos) 5. Análise é trivial Data Lake — O Caminho de Alto Risco Características: ❌ Schema: nenhum (vai vir depois, promete) ❌ Documentação: sem prioridade ❌ Qualidade: aceita qualquer coisa ❌ Query speed: lento (dados bagunçados) Exemplo: Pasta S3 com 10.000 arquivos sem padrão. Fluxo: 1. Dados chegam (qualquer formato) 2. Você armazena (sem questionar) 3. Meses depois: "qual é o schema desses dados?" 4. Ninguém lembra 5. Análise é um mistério O Custo Real de Começar com Lake (E Isso Não É Teoria) Vou contar um case de verdade: Startup de E-commerce (2023) Dia 1: Mês 1: Coleta 500GB brutos Mês 6: Primeira tentativa de análise Mês 9: Impasse Mês 12: Congelamento Resultado: Investimento perdido: R$ 90k+ em salários Dados: 15TB desorganizados Análises: 0 (zero) Tempo: 1 ano O que foi feito errado: Começaram com Lake (sem schema, sem governança) esperando que "depois" viria organização. O Caminho Certo (Data Warehouse Primeiro) Dia 1: Semana 1: Definir Schema Semana 2-3: Load Inicial Semana 4: Primeira Análise Resultado: CEO tem relatório em 4 semanas, não 12 meses. Custo total: R$ 5k Quando (Realmente) Usar Data Lake? Data Lake é correto apenas em 2 cenários: Cenário 1: Você já tem um Data Warehouse maduro Exemplo: Netflix tem Data Warehouse para produto. Data Lake para ML training. Cenário 2: Você tem data engineering dedicada Exemplo: Google, Meta, empresas de 200+ engineers. A Arquitetura Medalhão (O Padrão Certo) Se você quer começar certo, siga o padrão Medallion Architecture da Databricks: Bronze (Raw Data) Dados exatamente como chegam (cópia 1:1) Nenhuma transformação Propósito: auditoria, replay se algo der errado Retenção: 6-12 meses Prata (Clean Data) Dados deduplicated Tipos corretos Sem valores nulos aleatórios Propósito: análises técnicas Retenção: 2+ anos Ouro (Business Data) Dados agregados, prontos para negócio KPIs calculados Lineage documentado Propósito: dashboards, decisões Retenção: 5+ anos Exemplo prático: Cada camada tem 1 responsabilidade clara. Governo de Dados (O Que Ninguém Faz, Mas Deveria) Se você vai montar um Data Lake/Warehouse, saiba: Sem governança, nada dura. Governança de dados = 20% tecnologia, 80% processo humano. Mínimo recomendado: ✅ Documentação: cada tabela tem descrição ("de onde vem?", "quando atualiza?", "quem mantém?") ✅ Schema registry: mudanças no schema são documentadas ✅ Data catalog: ferramenta pra descobrir "qual tabela tem X?" ✅ Quality checks: alertas se dados degradarem Ferramentas que ajudam: Pequeno: Excel + Google Sheets (documentação) + dbt (schema + tests) Médio: Data Catalog (Google, AWS, etc) + dbt + Slack alerts Grande: Databricks + Apache Atlas + dbt + monitoramento custom A Ordem Certa Para 2026 1. Comece com Data Warehouse (organizado, pequeno) Tempo: 4-8 semanas Custo: R$ 10-30k ROI: análises no dia 1, não no mês 12 2. Depois de 6 meses, adicione Lake (se precisar escalabilidade) Tempo: 2-4 semanas Custo: R$ 20-50k (mais governança) Propósito: backup bruto, experimentation, ML 3. Eventualmente, Medalhão Tempo: 3-6 meses Custo: R$ 50-200k (depende de escala) Propósito: maturidade data-driven Resumo — A Decisão | Aspecto | Data Warehouse | Data Lake | |---------|-----------------|-----------| | Schema | Definido antes | Sem definição | | Governança | Obrigatória | Esperança | | Tempo até 1ª análise | 4 semanas | 3-6 meses | | Custo inicial | R$ 20k | R$ 10k (enganoso) | | Custo 1 ano depois | R$ 20k | R$ 90k+ (governança atrasada) | | Risco