プレーンテキスト変換でできること
SNS のプロフィール、フォント変換ツール、PDF、チャットアプリからコピーしたテキストには、見た目以上のものが含まれていることがよくあります。おしゃれなフォントで書かれた名前は、実は数学用記号の並びです。ワープロで書いた文には、カーブした引用符や長いダッシュが入っています。メッセージの中に、パスワード欄や表計算ソフトの数式を壊すゼロ幅スペースが隠れていることもあります。このツールはそうした文字を見つけ、キーボードで打てる普通の文字に置き換えます。
日本のユーザーにとっては、全角英数字を半角に変換するツールとしても使えます。「ABC123」のような全角の英字と数字は半角の「ABC123」になり、全角スペースも半角スペースに変わります。ひらがな、カタカナ、漢字、「、」「。」、かぎかっこはそのまま残ります。ただし全角の「!」「?」「()」「:」なども半角に変わる点と、半角カタカナ(アイウ)は全角に変換されない点に注意してください。
次のような場面で使えます。
- フォント変換ツールで作った文字が、ユーザー名の欄や検索欄で使えない
- 貼り付けた名前やコードが、見た目は同じなのに一致しない
- フォームで「使用できない文字が含まれています」と表示される
- コード、CSV ファイル、コマンドライン用にまっすぐな引用符が必要
- 取り消し線付きの文字やグリッチ文字が送られてきて、普通に読みたい
使い方
- 整えるテキストに貼り付けます。さまざまな問題を含むサンプルがあらかじめ入っているので、先に結果を確認できます。
- 入力に合わせてプレーンテキスト欄が更新されます。
- 整える内容を選びます。初期設定では次の5つがオンです。
- 装飾フォントを普通の文字に
- 引用符・ダッシュ・三点リーダーをキーボードの記号に
- 見えない文字を削除
- グリッチ・取り消し線の記号を削除
- 特殊な空白と連続スペースを修正
- 次の2つは初期設定でオフです:アクセント記号を削除(é を e に)と絵文字を削除。
- コピーまたはダウンロードを押します。ツールの下に、「4文字を整えました。」のように整えた文字の数が表示されます。
Mac のファイル名などからコピーしたテキストでは、「ガ」が「カ」と濁点の2文字に分かれていることがあります。このツールはそうした文字を1文字に結合し、結合した文字も整えた文字の数に含めます。たとえば「ガイド データ」の濁点が分かれたものは、3文字の結合と全角スペース1つで「4文字を整えました。」と表示されます。
変換例
表に記載がない限り、各結果はこのツールの初期設定で実際に変換したものです。
| 入力 | 出力 |
|---|---|
| 𝗕𝗼𝗹𝗱 text | Bold text |
| 𝐼𝑡𝑎𝑙𝑖𝑐 | Italic |
| 𝓈𝒸𝓇𝒾𝓅𝓉 | script |
| 𝔹𝕒𝕝𝕝 | Ball |
| wide | wide |
| Ⓑⓤⓑⓑⓛⓔ | Bubble |
| ꜱᴍᴀʟʟ ᴄᴀᴘꜱ | small caps |
| S̶t̶r̶i̶k̶e̶ | Strike |
| “It’s fine,” she said… | “It’s fine,” she said… |
| Wait、エムダッシュ、what?(スペースなし) | Wait-what? |
| Café crème(アクセント記号を削除:オン) | Cafe creme |
| Great job の後に絵文字2つ(絵文字を削除:オン) | Great job |
日本語を含む例では、「ABC123!(テスト)、。「かな」アイウ」が「ABC123!(テスト)、。「かな」アイウ」になります。
仕組み
コンピューター上のあらゆる文字の基になっている規格 Unicode には、普通の文字を装飾したコピーのような文字がたくさん含まれています。その多くには、どの普通の文字に対応するかを示す公式の情報が付いています。このツールはその情報を使って、装飾された文字を A〜Z や 0〜9 に戻します。全角英数字もこの仕組みで半角に戻ります。スモールキャピタルや黒い四角で囲んだ文字など一部のスタイルには公式の対応がないため、それらは独自の対応表で変換します。
ほかのオプションも、同じように文字のグループごとに処理します。
- カーブした引用符、ダッシュ、三点リーダーは、’、“、-、ピリオド3つに変わります。エムダッシュ(U+2014)、エンダッシュ(U+2013)、マイナス記号も対象です。箇条書きの記号はハイフンになります。日本語の文章で使う「…」も「…」に変わるので、残したい場合はこのオプションをオフにしてください。
- 見えない文字は削除されます。ゼロ幅スペース、ゼロ幅接合子、ソフトハイフン、BOM(バイトオーダーマーク)、方向制御文字、ハングルフィラーや点字の空白などの空白用の文字が含まれます。
- グリッチや取り消し線の記号は、文字の上に重ねられた結合記号です。これを削除すると下の文字だけが残ります。é のアクセントのように文字に属する1つの記号は残ります。
- ノーブレークスペースやエムスペース、全角スペースなどの特殊な空白は通常のスペースになり、行内の連続スペースは1つにまとめられます。
ヒンディー語、アラビア語、中国語、日本語などの文字はそのままです。変更されるのは上で挙げた特定の文字だけです。
コツと注意点
- 上付きの数字は残ります。 x² を x2 に変えると意味が変わってしまうため、上付き文字で書かれた数字には手を加えません。
- 逆さ文字や鏡文字は、ほかの文字体系の似た形の文字を使っています。これらは元に戻りません。鏡文字は、鏡文字ジェネレーターの逆方向の変換を使ってください。
- アクセント記号は選択制です。 名前や普通の文章では「アクセント記号を削除」をオフのままにしてください。ファイル名、URL、ASCII 文字しか受け付けないシステム向けにはオンにします。
- 絵文字の削除では一部の記号も消えます。 Unicode では著作権記号なども同じグループに分類されているためです。
- 長いダッシュだけを扱いたい場合は、エムダッシュ削除ツールを使うと置き換え方を細かく選べます。
ほかの方法
Microsoft Word や Google ドキュメントの「書式なしで貼り付け」(多くのブラウザーやドキュメントでは Ctrl+Shift+V)では、太字、色、リンクは消えますが、装飾 Unicode 文字、カーブした引用符、見えない文字は残ります。それらは書式ではなく文字だからです。Excel や Google スプレッドシートでは、=CLEAN(A1) で一部の制御文字を、=TRIM(A1) で余分なスペースを削除できますが、どちらも装飾された文字には効きません。コードでは、Unicode 正規化(JavaScript なら text.normalize('NFKC')、Python なら unicodedata.normalize('NFKC', text))でほとんどの装飾文字を変換できます。ただし ½ や上付き文字など、残したいものまで変わってしまいます。日本語の場合は、半角カタカナも全角に変わります。
HTML タグや Markdown の記号を取り除きたい場合は書式削除ツールを、スペースと空行だけを整えたい場合は空白削除ツールを使ってください。