この Unicode 文字変換ツールでできること
Unicode は、英字の A から漢字、矢印、絵文字まで、あらゆる文字に番号を割り当てる規格です。その数万もの文字の中に、太字、斜体、筆記体、ドイツ文字(フラクトゥール)、黒板太字(ダブルストラック)、等幅の完全なアルファベットが含まれています。これらは主に数学のために用意されたもので、数学では文字の書体が意味を変えることがあります。
これらは独立した文字なので、プレーンテキストしか受け付けない場所でも「フォント」のように使えます。この Unicode 文字変換ツールは、入力した単語をそうした文字に変換し、何が出力されたのかをコードポイント単位まで正確に見せてくれます。
使い方
- 「テキスト」欄に入力または貼り付けます。空から始めたいときは「クリア」を押します。
- 上部の6つの主要な結果に、太字、斜体、筆記体、ドイツ文字、黒板太字、等幅で表示されます。どれでも横の「コピー」を押せます。
- コードポイントパネルで、「コードポイントを表示」のメニューからスタイルを選びます。入力した元のテキストを調べるには「入力したままのテキスト」を選びます。
- 各文字の下に U+ のコードが表示されます。結合文字は点線の円の上に、スペースは ␣、改行は ↵ で表示されます。
- 要約の行で、コードポイント数、UTF-16 の単位数、UTF-8 のバイト数を確認します。
- 「コードポイントをコピー」を押すと、「U+1D400 U+1D401」のような一覧をテキストとしてコピーできます。
- 「その他のスタイル」までスクロールすると、このサイトのほかのスタイルがすべて「コピー」ボタン付きで表示されます。
仕組み
主要なスタイルのほとんどは、U+1D400 から U+1D7FF までの「数学用英数字記号」ブロックから来ています。このブロックはスタイルごとに大文字26個、小文字26個がきれいに並んでいるので、変換ツールは先頭の文字から数えて装飾文字を見つけます。
一部の文字は、何年も前に「文字様記号(Letterlike Symbols)」ブロックに追加済みでした。実数を表す ℝ、フラクトゥールの ℌ、斜体の ℎ などです。数学用ブロックではそれらの位置が空いているため、変換ツールは古い方の文字で埋めます。コードポイントパネルを見ればすぐにわかります。ドイツ文字の単語の中で、大文字 H だけが U+1D500 台ではなく U+210C になっています。
ほかのスタイルは Unicode の別の場所を使います。バブル文字は「囲み英数字」、ワイドな文字は「半角・全角形」ブロック、スモールキャピタルは発音記号の文字、下線や取り消し線は直前の文字に付く結合文字から作られています。
これらの文字の多くは「互換」文字です。Unicode が定める NFKC 正規化では、太字の 𝐀 は通常の A に戻ります。検索エンジンや Unicode テキスト変換(元に戻す)のようなツールが装飾を元に戻せるのはこのためです。
変換例
各主要スタイルの文字 A と、変換ツールのパネルに表示されるコードポイントとサイズです。
| スタイル | 文字 | コードポイント | UTF-16 単位 | UTF-8 バイト |
|---|---|---|---|---|
| Plain | A | U+0041 | 1 | 1 |
| 太字 | 𝐀 | U+1D400 | 2 | 4 |
| 筆記体 | 𝒜 | U+1D49C | 2 | 4 |
| ドイツ文字 | 𝔄 | U+1D504 | 2 | 4 |
| 黒板太字 | 𝔸 | U+1D538 | 2 | 4 |
| 等幅 | 𝙰 | U+1D670 | 2 | 4 |
| ドイツ文字の H | ℌ | U+210C | 1 | 3 |
単語「Unicode」全体を各主要スタイルにした結果です。
| スタイル | 結果 |
|---|---|
| 太字 | 𝐔𝐧𝐢𝐜𝐨𝐝𝐞 |
| 斜体 | 𝑈𝑛𝑖𝑐𝑜𝑑𝑒 |
| 筆記体 | 𝒰𝓃𝒾𝒸ℴ𝒹ℯ |
| ドイツ文字 | 𝔘𝔫𝔦𝔠𝔬𝔡𝔢 |
| 黒板太字 | 𝕌𝕟𝕚𝕔𝕠𝕕𝕖 |
| 等幅 | 𝚄𝚗𝚒𝚌𝚘𝚍𝚎 |
太字の「Unicode」は、7コードポイント、UTF-16 で14単位、UTF-8 で28バイトです。通常の文字で入力すると、どれも7です。
参考までに、ひらがなの「あ」は U+3042 で、UTF-16 では1単位、UTF-8 では3バイトです。日本語のテキストを「入力したままのテキスト」で調べると、こうした値がパネルに表示されます。
コードポイントパネルが役立つ人
- 「見た目は短い」テキストがデータベースのフィールド、API、フォームで弾かれる理由を調べている開発者
- プロフィールがなぜ早く文字数の上限に達するのかを知りたい SNS 担当者
- あるスタイルを使う前に、どの文字が使われているのかを確認したいライターやデザイナー
- 単語の中の1文字だけ見た目が少し違う理由が気になるすべての人
ヒントと制限
文字数制限の数え方はさまざま。 コードポイントを数えるシステム、UTF-16 の単位を数えるシステム、バイトを数えるシステムがあります。要約の行を、アプリが実際に使っているルールと照らし合わせてください。日本語のサービスでは「全角1文字=半角2文字」と数える場合もあり、これはここに表示される値とは別の数え方です。
すべての文字にスタイルがあるわけではない。 アクセント付きの文字、ほとんどの記号、ほかの文字体系の文字には太字や筆記体の形がないため、変換されずにそのまま残ります。ひらがな、カタカナ、漢字も同じで、変わるのは英字(スタイルによっては数字も)だけです。
スクリーンリーダーと検索。 支援技術は装飾文字を数学記号として読み上げたり読み飛ばしたりすることが多く、ほとんどの検索ボックスでは通常の単語と一致しません。重要な情報は通常の文字で書いてください。
見た目はフォント次第。 Unicode が決めるのは「どの文字か」で、描くのは読む人の端末のフォントです。古い端末では空の四角が表示されることがあります。
見えない文字。 パネルには、目に見えない文字も表示されます。空白の名前やスペースの小技を使っているなら、透明文字ジェネレーターでそれぞれの文字の説明を確認できます。
関連ツール
おしゃれ文字ジェネレーターは、これらのスタイルに飾りや似た形の文字を組み合わせます。どのスタイルも、Unicode テキスト変換(元に戻す)で元に戻せます。