Ir para o conteúdo
OneKitly

O número 1 e o texto «1» não são duplicados

Publicado a 01/09/2026 · 4 min de leitura · Ferramentas de ficheiros

Daniel Okonkwo

Daniel OkonkwoProgramador front-end e redator de Tecnologia na OneKitly

Desempenho web · Formatos de ficheiro

Verificado a partir de 3 fontes

Ver perfil
Em resumo

A ferramenta guarda a primeira ocorrência de cada linha distinta e descarta as restantes, comparando o tuplo completo de células em vez de uma coluna-chave — dois clientes com o mesmo nome mas moradas diferentes sobrevivem ambos, que é o que se quer. O que surpreende é que a comparação é exata e tipada. Passada sobre cinco linhas que se mostram todas como «1, a» — o número 1, o texto «1», o número outra vez, o mesmo número escrito 1.0, e o texto «1» com um espaço à frente — deixa três: o número, o texto simples e o texto com espaço são três linhas diferentes, ao passo que 1 e 1.0 são o mesmo número e dobram-se. Não é um defeito: é a única comparação que não pode fundir em silêncio dois registos que diferem. Implica que uma coluna importada como texto de um ficheiro e como números de outro não se removerá contra si própria, e a correção está a montante: torna a coluna de um só tipo antes de juntar, não depois.

A remoção de duplicados compara linhas inteiras de forma exata, tipo de célula incluído. Cinco linhas de aspeto idêntico saíram como três: uma levava um número, outra uma cadeia e outra uma cadeia com um espaço à frente.

De onde vêm os tipos misturados

Quase sempre de uma importação. Um CSV não tem tipos — cada campo é texto até que algo decida o contrário — por isso o programa que o abriu adivinhou, e adivinha de forma diferente consoante as primeiras linhas da coluna, a configuração regional e se um valor tem um zero inicial ou um sinal de moeda. Os números de referência são a vítima habitual: 00412 é texto num ficheiro porque o zero tem de ser guardado, e o número 412 noutro porque parecia numérico. Junta os dois e a mesma referência dá duas linhas.

A outra fonte são os espaços invisíveis. Um espaço final sobrevive a um copiar-colar de uma página web, de um PDF ou de um e-mail, e torna diferentes duas células de resto idênticas para qualquer comparação exata — a remoção de duplicados aqui, mas também as procuras, as junções e as tabelas dinâmicas em todo o lado. Limpá-lo é um localizar e substituir antes da junção, e vale a pena fazê-lo em qualquer coluna com que tenciones cruzar.

Linhas inteiras, não uma coluna-chave

Comparar a linha inteira é a opção prudente, e convém entendê-la como tal. Duas linhas que coincidem no número de referência mas diferem num campo de morada são guardadas, porque a ferramenta não pode saber qual das duas moradas está em vigor — decidi-lo é um juízo sobre os teus dados, não uma operação sobre eles. Se quiseres remover duplicados por uma só coluna, ordena primeiro por essa coluna e tira tu os excedentes; o resultado é o mesmo e a decisão continua a ser tua. A linha de cabeçalho nunca é tomada por duplicado de nada: um ficheiro cuja primeira linha repete um valor do corpo guarda ambas.

Cinco linhas que se mostram todas como «1, a» — sobrevivem três
Célula tal como guardadaGuardada ou retiradaPorquê
número 1GuardadaPrimeira ocorrência
texto «1»GuardadaUma cadeia não é um número
de novo o número 1RetiradaIdêntica à primeira linha
número 1.0RetiradaO mesmo número escrito de outro modo
texto « 1» com um espaçoGuardadaUma cadeia diferente
Remover linhas duplicadasElimine as linhas idênticas a uma anterior, mantendo o cabeçalho e a primeira ocorrência. Funciona com Excel (XLSX, XLS, XLSM, XLSB), OpenDocument (ODS), Apple Numbers, CSV e TSV.Experimentar a ferramenta

Perguntas frequentes

Qual dos duplicados é conservado?
O primeiro do ficheiro, pela ordem em que as linhas aparecem. Tudo o que se segue é descartado. Se as linhas diferirem numa coluna em que não pensaste olhar, a que fica é a mais antiga, não a melhor — por isso, se a atualidade importa, ordena a folha antes de remover duplicados e não depois.
Como torno uma coluna misturada de um só tipo?
Decide o que a coluna realmente é e converte-a por inteiro numa só operação antes de juntar. Números de referência, códigos postais e telefones são texto — têm zeros iniciais e nunca se somam. Montantes e contagens são números. Numa folha de cálculo, formata a coluna e depois passa por texto para colunas ou uma coluna auxiliar com TEXTO ou VALOR para forçar cada célula; o formato sozinho não muda o que está guardado.
Olha entre as folhas de um livro?
Trabalha sobre uma folha de cada vez, que é o que se quer quando os separadores contêm coisas diferentes. Para remover duplicados entre vários ficheiros ou separadores, junta-os primeiro numa só folha — a junção por linhas empilha as linhas de cada ficheiro numa única tabela e guarda só o primeiro cabeçalho — e depois corre isto sobre o resultado.

Artigos que podem interessar-lhe

Todos os guias
ExplicaçãoConverter fórmulas em valores guarda a resposta em cache, não o cálculoUm ficheiro de folha de cálculo guarda ao mesmo tempo a fórmula e a última resposta calculada pelo Excel. Retirar a fórmula deixa a resposta guardada — e deixa um vazio onde o ficheiro nunca levou nenhuma.ComparaçãoXLS, XLSX, XLSM e XLSB: qual é qual, e qual lhe convémQuatro extensões, três delas a mesma caixa com tampas diferentes. Mude a extensão de um XLSX para .zip e ele abre — só esse facto explica toda a família, e explica porque é que o XLS, que não abre assim, continua a ser o que dá problemas.ExplicaçãoPorque é que o seu CSV parte os acentos e as datas no ExcelTrês avarias completamente diferentes escondem-se atrás da mesma frase. Uma é a codificação, outra o separador, outra o Excel a adivinhar tipos enquanto abre o ficheiro — e o remédio é diferente para cada uma. Eis como distingui-las em cinco segundos.TutorialExtrair o texto de um PDF, e o que a paginação lhe fazUm PDF guarda glifos em coordenadas — não linhas, não parágrafos, não uma ordem de leitura. A extração reconstrói o texto a partir dessas posições, e é por isso que duas colunas saem entrelaçadas, uma tabela perde as células e uma digitalização não dá nada. Medido executando a ferramenta.TutorialDe SRT para texto: obter uma transcrição limpa a partir de legendasRetirar os números e as marcas de tempo é a metade fácil. A que decide se a transcrição se lê são as etiquetas de itálico, os travessões de diálogo, as descrições sonoras e as frases partidas em duas legendas — e este conversor deixa-lhe todas elas.ComparaçãoZIP ou TAR: qual escolher, e porque é que isso importaUma só diferença de estrutura explica tudo o resto: o TAR não comprime, empilha; o ZIP comprime cada ficheiro por si. Medido em 60 ficheiros de código pequenos, dá 1 809 bytes contra 14 686.

Ferramentas relacionadas

Fontes

Detetaste um erro neste artigo?