일반 텍스트 변환기로 할 수 있는 일
SNS 프로필, 폰트 생성기, PDF, 메신저에서 복사한 텍스트에는 보이는 것보다 많은 것이 들어 있는 경우가 많습니다. 특수 폰트로 쓴 이름은 사실 수학 기호의 나열입니다. 워드 프로세서에서 가져온 문장에는 둥근 따옴표와 긴 대시가 들어 있습니다. 메시지 안에 폭이 없는 공백이 숨어 있어서 비밀번호 칸이나 스프레드시트 수식이 제대로 동작하지 않기도 합니다. 이 도구는 그런 문자를 찾아 키보드로 치는 문자로 바꿔, 서식 없는 일반 텍스트로 변환해 줍니다.
이럴 때 쓰면 좋습니다.
- 폰트 생성기로 만든 텍스트가 아이디 입력란이나 검색창에서 통하지 않을 때
- 붙여넣은 이름이나 코드가 똑같아 보이는데도 일치하지 않을 때
- 입력 양식이 “잘못된 문자”라며 텍스트를 거부할 때
- 코드, CSV 파일, 명령줄에 쓸 곧은 따옴표가 필요할 때
- 누군가 보낸 취소선 글씨나 글리치 텍스트를 평범하게 읽고 싶을 때
사용 방법
- 정리할 텍스트 칸에 붙여넣습니다. 여러 문제가 섞인 예시가 미리 들어 있어 결과를 먼저 확인할 수 있습니다.
- 입력하는 동안 일반 텍스트 칸이 바로 바뀝니다.
- 정리할 항목을 고릅니다. 다섯 가지 옵션이 기본으로 켜져 있습니다.
- 특수 폰트를 일반 문자로
- 둥근 따옴표, 대시, 말줄임표를 키보드 문자로
- 보이지 않는 문자 제거
- 글리치와 취소선 기호 제거
- 특수 공백과 이중 공백 정리
- 두 가지 옵션은 기본으로 꺼져 있습니다. 악센트 제거(é를 e로)와 이모지 제거입니다.
- 복사 또는 다운로드를 누릅니다. 도구 아래의 안내 문구에 정리한 문자 수가 표시됩니다.
예시
표에 따로 적지 않았다면 모든 결과는 기본 설정에서 이 도구로 만든 것입니다.
| 붙여넣은 텍스트 | 결과 |
|---|---|
| 𝗕𝗼𝗹𝗱 text | Bold text |
| 𝐼𝑡𝑎𝑙𝑖𝑐 | Italic |
| 𝓈𝒸𝓇𝒾𝓅𝓉 | script |
| 𝔹𝕒𝕝𝕝 | Ball |
| wide | wide |
| Ⓑⓤⓑⓑⓛⓔ | Bubble |
| ꜱᴍᴀʟʟ ᴄᴀᴘꜱ | small caps |
| S̶t̶r̶i̶k̶e̶ | Strike |
| “It’s fine,” she said… | “It’s fine,” she said… |
| Wait 뒤에 엠 대시, 이어서 what? (공백 없이 씀) | Wait-what? |
| Café crème, 악센트 제거 켬 | Cafe creme |
| Great job 뒤에 이모지 두 개, 이모지 제거 켬 | Great job |
한국어 텍스트로 실행한 결과입니다. 모두 기본 설정입니다.
| 붙여넣은 텍스트 | 결과 |
|---|---|
| 𝗕𝗼𝗹𝗱 한글은 그대로 | Bold 한글은 그대로 |
| (주)ABC 123 (전각 문자와 전각 공백) | (주)ABC 123 |
| 닉네임과 테스트 사이에 한글 채움 문자(U+3164) | 닉네임테스트 |
| “안녕하세요”… | “안녕하세요”… |
작동 원리
컴퓨터의 모든 텍스트를 다루는 표준인 유니코드에는 일반 문자를 꾸며 놓은 복사본이 많이 들어 있습니다. 그중 대부분에는 어떤 일반 문자를 나타내는지 알려 주는 공식 정보가 붙어 있습니다. 변환기는 이 정보를 이용해 꾸민 글자를 AZ나 09로 되돌립니다. 스몰캡이나 검은 네모 글자처럼 공식 연결 정보가 없는 몇 가지 스타일은 도구에 내장된 표로 변환합니다.
다른 옵션도 같은 방식으로, 문자 묶음을 하나씩 처리합니다.
- 둥근 따옴표, 대시, 말줄임표는 ’, “, -, 마침표 세 개로 바뀝니다. 엠 대시(U+2014), 엔 대시(U+2013), 빼기 기호도 포함됩니다. 글머리 기호는 하이픈이 됩니다.
- 보이지 않는 문자는 지워집니다. 폭 없는 공백, 폭 없는 결합자, 소프트 하이픈, 바이트 순서 표시(BOM), 방향 표시 문자, 그리고 한글 채움 문자(Hangul Filler)나 점자 빈칸(Braille Blank) 같은 빈칸 채움 문자가 해당됩니다.
- 글리치와 취소선 기호는 글자 위에 겹쳐 쌓인 결합 문자입니다. 이것을 지우면 아래의 글자만 남습니다. é처럼 글자에 원래 붙어 있는 악센트 하나는 남깁니다.
- 특수 공백인 줄바꿈 없는 공백(no-break space)이나 엠 공백은 일반 공백이 되고, 한 줄 안에서 연달아 있는 공백은 하나로 줄어듭니다.
힌디어, 아랍어, 중국어, 한국어 등 다른 문자는 그대로 둡니다. 위에 적은 문자만 바뀝니다.
한국어 사용자를 위한 참고
- 한글은 바뀌지 않습니다. 특수 폰트 변환은 라틴 문자와 숫자에만 적용되므로, 한글과 영어가 섞인 닉네임이나 프로필 문구를 넣으면 영어 부분만 일반 문자로 돌아옵니다.
- 투명 닉네임용 문자도 지워집니다. 빈 닉네임이나 공백처럼 보이게 하려고 쓰는 한글 채움 문자(U+3164)는 보이지 않는 문자 제거가 켜져 있으면 삭제됩니다. 이 문자를 남기려면 이 옵션을 끄면 됩니다.
- 전각 문자는 반각으로 바뀝니다. 일부 입력기나 문서에서 들어오는 전각 영문, 전각 숫자, 전각 괄호는 일반 문자로, 전각 공백(U+3000)은 일반 공백으로 바뀝니다.
- 자모가 분리된 한글도 정리됩니다. macOS에서 만든 파일 이름처럼 초성, 중성, 종성이 따로 저장된 한글(NFD)은 변환 결과에서 자모가 합쳐진 일반적인 형태(NFC)로 나옵니다. 화면에서는 차이가 보이지 않지만 안내 문구의 정리한 문자 수에는 포함됩니다. 합쳐지면서 줄어든 문자 수만큼 세므로, 자모가 분리된 “한글 자모”를 넣으면 “문자 6개를 정리했습니다.”라고 나옵니다. 복사한 결과는 합쳐진 형태입니다.
- 한국어 문장 부호는 그대로입니다. 낫표(「 」), 겹낫표(『 』), 가운뎃점은 바뀌지 않습니다.
팁과 한계
- 위 첨자 숫자는 그대로 둡니다. x²를 x2로 바꾸면 뜻이 달라지므로 위 첨자로 쓴 숫자는 건드리지 않습니다.
- 뒤집힌 글씨와 거울 글씨는 다른 문자 체계의 비슷한 글자를 빌려 씁니다. 이런 글자는 되돌리지 않습니다. 거울 글씨는 거울 글씨 생성기의 반대 방향 변환을 쓰면 됩니다.
- 악센트 제거는 선택 사항입니다. 이름이나 일반 글에서는 꺼 두고, 파일 이름, URL, ASCII만 받는 시스템에 쓸 때 켭니다.
- 이모지를 지우면 일부 기호도 함께 지워집니다. 유니코드에서 저작권 기호 같은 기호를 이모지와 같은 묶음으로 분류하기 때문입니다.
- 긴 대시만 처리하면 된다면 엠 대시 제거가 무엇으로 바꿀지를 더 세밀하게 정할 수 있습니다.
다른 방법
Word와 Google 문서에서 서식 없이 붙여넣기(대부분의 브라우저와 Google 문서에서 Ctrl+Shift+V)를 하면 굵게, 색, 링크는 빠집니다. 하지만 특수 유니코드 글자, 둥근 따옴표, 보이지 않는 문자는 서식이 아니라 문자이기 때문에 그대로 남습니다. Excel이나 Google 스프레드시트에서는 =CLEAN(A1)이 일부 제어 문자를, =TRIM(A1)이 불필요한 공백을 지우지만 꾸민 글자는 둘 다 건드리지 않습니다. 코드에서는 유니코드 정규화(JavaScript의 text.normalize('NFKC'), Python의 unicodedata.normalize('NFKC', text))로 꾸민 글자 대부분을 바꿀 수 있지만, ½이나 위 첨자처럼 남기고 싶은 문자까지 바뀝니다.
HTML 태그나 마크다운 기호를 지우려면 텍스트 서식 제거를 쓰면 됩니다. 공백과 빈 줄만 정리하려면 공백 제거가 맞습니다.