Cliente cadastrado duas vezes, mesmo CPF em duas linhas, e-mail repetido de importações diferentes. Remover duplicata parece trivial até você reparar que a "duplicata" às vezes não é uma cópia exata. Excel e Google Planilhas têm ferramenta nativa pra isso, mas ela só compara o valor exatamente como está escrito.
O jeito nativo no Excel
- Selecione o intervalo de dados (incluindo o cabeçalho).
- Vá em Dados → Remover Duplicatas.
- Marque só a(s) coluna(s) que definem "é o mesmo registro": normalmente CPF, ou e-mail se não tiver CPF na planilha. Marcar todas as colunas faz o Excel só considerar duplicata quando a linha inteira é idêntica, o que raramente acontece de verdade.
- Confirme. O Excel mostra quantas linhas removeu e quantas ficaram.
O jeito nativo no Google Planilhas
- Selecione o intervalo de dados.
- Vá em Dados → Limpeza de dados → Remover duplicatas.
- Escolha as colunas-chave (mesma lógica: CPF ou e-mail, não a linha inteira).
- Confirme a remoção.
Onde essa ferramenta deixa passar duplicata
O Remover Duplicatas do Excel e do Google Planilhas compara texto exato, célula por célula. Duas linhas com o mesmo CPF, mas escritas de formas diferentes, não são reconhecidas como duplicata:
Linha 12: 12345678909
→ mesmo CPF, mas o Excel enxerga como dois valores diferentes → nenhuma das duas é removida
O mesmo vale pra e-mail com maiúscula/minúscula diferente (Joao@Empresa.com vs joao@empresa.com) e telefone com ou sem o "9" na frente, com ou sem DDD entre parênteses.
Marcando duplicatas sem apagar nada ainda
Antes de remover de vez, uma fórmula pra só sinalizar, mais seguro que confiar direto na ferramenta nativa. Assumindo o CPF (só números, já sem pontuação) na coluna A a partir de A2:
| Célula | O que calcula | Fórmula |
|---|---|---|
| B2 | Já apareceu antes nesta coluna? | =COUNTIF($A$2:A2,A2)>1 |
Arraste essa fórmula até a última linha. O intervalo $A$2:A2 "cresce" conforme desce (a primeira parte é fixa, a segunda não), por isso o resultado é FALSO na primeira aparição de cada CPF e VERDADEIRO só a partir da segunda. Filtra por VERDADEIRO na coluna B, revisa as linhas marcadas, e só então decide remover.
Se o CPF pode estar formatado de jeitos diferentes entre as linhas, normalize antes de comparar, numa coluna auxiliar:
| Célula | O que calcula | Fórmula |
|---|---|---|
| C2 | CPF só com números, sem pontuação | =SUBSTITUTE(SUBSTITUTE(A2,".",""),"-","") |
| D2 | Já apareceu antes (comparando a versão limpa) | =COUNTIF($C$2:C2,C2)>1 |
Qual coluna usar como chave
Nem toda coluna serve igual pra identificar "é a mesma pessoa":
- CPF: a mais confiável. Único por pessoa, não muda, não é compartilhado.
- E-mail: boa alternativa quando não tem CPF, mas duas pessoas da mesma família às vezes usam o mesmo e-mail, e erro de digitação passa despercebido.
- Telefone: a mais fraca das três. Número trocado de operadora, celular compartilhado entre familiares, e formatação inconsistente (com ou sem DDD, com ou sem o 9) tornam telefone um identificador arriscado sozinho.
Na dúvida, use CPF; sem CPF, e-mail; telefone só como último recurso.
Duplicata de verdade, não só duplicata exata
O Zolyx primeiro corrige a formatação de CPF, telefone e e-mail, e só depois compara: assim duas linhas do mesmo cliente escritas de forma diferente são reconhecidas como a mesma pessoa, com CPF como critério preferencial e e-mail ou telefone como alternativa automática.
Testar com minha planilha