O que este conversor de texto Unicode faz
O Unicode é o padrão que dá um número a cada caractere, da letra A aos caracteres chineses, setas e emojis. Entre seus muitos milhares de caracteres estão alfabetos completos em negrito, itálico, cursiva, gótico, traço duplo e monoespaçado. Eles existem principalmente para a matemática, em que o estilo de uma letra pode mudar o seu significado.
Como essas letras são caracteres separados, você pode usá-las como “fontes” em lugares que só aceitam texto simples. Este conversor de texto Unicode transforma suas palavras nesses caracteres e mostra exatamente o que produziu, até o código de cada caractere.
Como usar o conversor
- Digite ou cole na caixa Seu texto, ou clique em Limpar para começar do zero.
- Os seis resultados principais no topo mostram seu texto em Negrito, Itálico, Cursiva, Gótico, Traço Duplo e Monoespaçado. Clique em Copiar ao lado de qualquer um deles.
- No painel de códigos, escolha um estilo no menu Mostrar códigos de. Escolha “Seu texto como digitado” para examinar o texto original.
- Cada caractere aparece com o código U+ embaixo. As marcas combinantes aparecem sobre um círculo pontilhado, os espaços como ␣ e as quebras de linha como ↵.
- Leia a linha de resumo com a contagem de códigos Unicode (code points), unidades UTF-16 e bytes UTF-8.
- Clique em Copiar códigos para copiar a lista inteira como texto, por exemplo “U+1D400 U+1D401”.
- Desça até Mais estilos para ver todos os outros estilos do site, cada um com um botão Copiar.
Como funciona
A maioria dos estilos principais vem do bloco de Símbolos Alfanuméricos Matemáticos, que vai de U+1D400 a U+1D7FF. Ele é organizado em sequências certinhas de 26 maiúsculas e 26 minúsculas por estilo, então o conversor encontra uma letra estilizada contando a partir da primeira.
Algumas letras já tinham entrado no Unicode anos antes, no bloco de Símbolos Parecidos com Letras, como ℝ para os números reais, ℌ em Fraktur e ℎ em itálico. O bloco matemático deixa essas posições vazias, e o conversor as preenche com os caracteres mais antigos. O painel de códigos deixa isso fácil de perceber: em uma palavra em gótico, o H maiúsculo mostra U+210C, e não um número na faixa de U+1D500.
Outros estilos usam partes diferentes do Unicode. As letras em bolinha vêm dos Alfanuméricos Delimitados, as letras largas do bloco de Formas de Meia Largura e Largura Total, o versalete das letras fonéticas, e o sublinhado e o riscado de marcas combinantes que se prendem à letra anterior.
Muitos desses caracteres são formas de “compatibilidade”. Na normalização NFKC definida pelo Unicode, um 𝐀 em negrito volta a ser um A comum. É assim que mecanismos de busca e ferramentas como o conversor de Unicode em texto conseguem desfazer o estilo.
Exemplos
A letra A em cada estilo principal, com códigos e tamanhos tirados do próprio painel do conversor:
| Estilo | Caractere | Code point | Unidades UTF-16 | Bytes UTF-8 |
|---|---|---|---|---|
| Comum | A | U+0041 | 1 | 1 |
| Negrito | 𝐀 | U+1D400 | 2 | 4 |
| Cursiva | 𝒜 | U+1D49C | 2 | 4 |
| Gótico | 𝔄 | U+1D504 | 2 | 4 |
| Traço Duplo | 𝔸 | U+1D538 | 2 | 4 |
| Monoespaçado | 𝙰 | U+1D670 | 2 | 4 |
| H gótico | ℌ | U+210C | 1 | 3 |
E uma palavra inteira, “Unicode”, em cada estilo principal:
| Estilo | Resultado |
|---|---|
| Negrito | 𝐔𝐧𝐢𝐜𝐨𝐝𝐞 |
| Itálico | 𝑈𝑛𝑖𝑐𝑜𝑑𝑒 |
| Cursiva | 𝒰𝓃𝒾𝒸ℴ𝒹ℯ |
| Gótico | 𝔘𝔫𝔦𝔠𝔬𝔡𝔢 |
| Traço Duplo | 𝕌𝕟𝕚𝕔𝕠𝕕𝕖 |
| Monoespaçado | 𝚄𝚗𝚒𝚌𝚘𝚍𝚎 |
Em Negrito, “Unicode” tem 7 code points, 14 unidades UTF-16 e 28 bytes UTF-8. Digitada normalmente, tem 7 de cada.
As letras acentuadas do português ficam no meio do caminho. O “ç” comum é U+00E7: um code point, uma unidade UTF-16 e dois bytes UTF-8. Como os alfabetos estilizados não têm letras com acento, o painel também mostra quando um “ã” ou um “ç” passou sem mudar no meio de uma palavra estilizada.
Para quem o painel de códigos é útil
- Desenvolvedores que querem entender por que um campo de banco de dados, uma API ou um formulário recusa um texto que “parece” curto
- Gestores de redes sociais tentando descobrir por que uma bio bate no limite antes da hora
- Redatores e designers que querem confirmar quais caracteres um estilo usa antes de confiar nele
- Curiosos que querem saber por que uma letra de uma palavra parece um pouco diferente das outras
Dicas e limites
Os limites de tamanho variam. Alguns sistemas contam code points, outros contam unidades UTF-16 e outros contam bytes. Compare a linha de resumo com a regra que o aplicativo realmente usa.
Nem todo caractere tem estilo. Letras acentuadas, a maior parte da pontuação e letras de outros alfabetos não têm forma em negrito ou cursiva, então passam sem mudança.
Leitores de tela e busca. As tecnologias assistivas muitas vezes leem as letras estilizadas como símbolos matemáticos ou pulam tudo, e a maioria das caixas de busca não as associa às palavras comuns. Deixe as informações importantes em texto comum.
As fontes decidem a aparência. O Unicode define qual é o caractere, e a fonte do aparelho de quem lê o desenha. Aparelhos mais antigos podem mostrar um quadradinho vazio.
Caracteres escondidos. O painel também revela caracteres que você não consegue ver. Se você trabalha com nomes em branco ou truques de espaçamento, o gerador de texto invisível explica cada um deles.
Ferramentas relacionadas
O gerador de letras diferentes acrescenta enfeites e alfabetos parecidos por cima desses estilos. Para desfazer qualquer estilo, use o conversor de Unicode em texto.