Ir para o conteúdo
OneKitly

Remover carateres não-ASCII

Remova todos os carateres fora do intervalo ASCII padrão do seu texto.

Remover carateres não-ASCII usa-se gratuitamente, as vezes que quiseres, diretamente nesta página. Está arrumada em Transformar e limpar no nosso catálogo, ao lado de Remover carateres repetidos e Remover acentos.

Como usar

  1. Abra a ferramenta — sem registo nem instalação.
  2. Introduza os seus dados ou ajuste as opções disponíveis.
  3. Obtenha o seu resultado ao instante e copie-o ou descarregue-o.

Perguntas frequentes

O que é Remover carateres não-ASCII?

Remova todos os carateres fora do intervalo ASCII padrão do seu texto.

Em que casos se usa na prática?

Limpar um texto colado antes de o reutilizar: remover duplicados de uma lista, uniformizar maiúsculas, tirar acentos para um nome de ficheiro ou ordenar linhas.

Qual é o erro mais comum?

Ordenar texto como se fosse ASCII. As letras acentuadas ficam depois do Z numa ordenação por bytes, o que coloca «Zurique» antes de «Émile» e produz uma lista que nenhum leitor aceitará.

Em que difere Remover carateres não-ASCII de Remover carateres repetidos?

Estão próximos mas respondem a perguntas diferentes: Remover carateres repetidos é o que deves abrir quando se trata de reduza as repetições do mesmo carácter a um só (helllo → helo). Escolhe o que corresponde ao teu ponto de partida — ambos são gratuitos.

Existe uma ferramenta para o passo seguinte?

Remover acentos é o mais próximo a seguir a este: Remova acentos e diacríticos do texto: é passa a e e ü a u.

Que mais vale a pena ter aberto ao lado?

Remover linhas em branco e Remover linhas duplicadas — surgem na mesma tarefa com frequência suficiente para merecerem outro separador.

De onde vêm os dados?

As transformações usam o tratamento Unicode do navegador, pelo que as mudanças de maiúsculas e a ordenação respeitam a localização, não a ordem de bytes. Nada é truncado: sai tudo o que entrou.

Para saber mais

Todos os guias
ExplicaçãoRetirar os acentos estraga a pesquisa — até o fazer dos dois ladosRebater os diacríticos é um passo de normalização, e a normalização só funciona quando a mesma função corre sobre o índice e sobre a consulta. NFC contra NFD com os pontos de código à vista, e as letras — ø, ł, ß, œ, ı — que saem do rebatimento intactas.ExplicaçãoOs emoji são mais difíceis do que parecem: porque «basta retirá-los» não tem resposta numa linhaUm emoji visível pode valer um ponto de código ou catorze unidades UTF-16. Corremos três expressões regulares populares sobre uma frase real e cada uma falhou de maneira diferente; uma apagou os algarismos. Eis porquê, que propriedade Unicode responde a que pergunta, e a regra de grupos de grafemas que funciona mesmo.TutorialLimpar texto desarrumado: a ordem das operações que realmente importaRetirar etiquetas antes de descodificar entidades, aparar antes de desduplicar, colapsar os espaços no fim. Três ordens executadas no Node, um pipeline de nove passos na sequência certa e os caracteres invisíveis — U+00A0, U+200B, U+FEFF — que sobrevivem a qualquer limpeza ingénua.ExplicaçãoDetetar o idioma de um texto e porque os textos curtos falhamMedido, não afirmado: 90 frases curtas reais em seis idiomas, nenhuma recusada e 68 certas — 76%, caindo para 64% abaixo de dezasseis letras. Quatro das respostas erradas voltaram com 100% de confiança.ExplicaçãoMaiúscula de frase e maiúscula de título: as regras mudam com a línguaAs maiúsculas de título inglesas têm três cortes diferentes consoante o manual de estilo. O português, o francês, o espanhol e o italiano não têm nenhum. O alemão capitaliza todos os substantivos. A ferramenta não sabe nada disto — eis exatamente o que faz.TutorialFiltrar linhas por um padrão sem linha de comandosIsto é o grep para quem não usa grep, com uma diferença importante: a procura é uma subcadeia literal, pelo que uma expressão regular a sério devolve uma caixa vazia e nenhum erro. Cada afirmação foi verificada executando a ferramenta.