単語出現頻度カウンターでわかること
単語出現頻度カウンターは、テキストの中で各単語が何回出てくるかを教えてくれるツールです。結果はランキング形式の一覧で、最もよく使われている単語から順に、1回しか出てこない単語まで並びます。
この一覧は、思った以上にいろいろな場面で役立ちます。書き手は、頼りすぎている単語を見つけるのに使います。学生は、スピーチや小説の語彙を研究するのに使います。検索エンジン向けに文章を書く人は、キーフレーズが何回出てくるかを確認するのに使います。研究者は、アンケートの回答やインタビューのメモを最初に概観するのに使います。
日本語の文章もそのまま貼り付けられます。日本語は単語の間にスペースを入れないので、ブラウザーの単語分割機能(Intl.Segmenter)で単語に分けてから数えます。たとえば「東京と大阪と東京」は「東京」2回、「と」2回、「大阪」1回になります。この分割は本格的な形態素解析ほど正確ではなく、活用する語が途中で分かれることもあるので、結果は目安として見てください。スペースで区切ったキーワードのリスト(「東京 大阪 東京」なら東京 2、大阪 1)は、そのとおりに数えられます。
使い方
- テキストをテキスト欄に貼り付けます。動作がわかるよう、最初はコーヒーについての短い段落が入っています。
- 集計単位で、単語、2語のフレーズ、3語のフレーズのいずれかを選びます。
- オプションを選びます。
- よく使われる単語を除外(初期設定でオン):「the」「and」「of」などの単語を除外します。
- 大文字小文字を区別しない(初期設定でオン):「Coffee」と「coffee」を同じ単語として数えます。
- 数字も数える(初期設定でオフ):2024 のような数字も単語として数えます。
- 短い単語を除きたい場合は、数える単語の最小文字数を設定します。4にすると、3文字以下の単語はすべて除かれます。
- 表を確認します。# は順位、回数はその項目が出てくる回数、割合はその割合です。
- コピーを押すと一覧をタブ区切りの3列としてコピーでき、CSV を押すと Excel や Google スプレッドシート用のファイルをダウンロードできます。
表の上には、含めた単語またはフレーズの総数である集計数、何種類の項目があるかを示す異なり数、最も多かった項目である最多が表示されます。
集計例
以下の結果は、ツールに最初から入っているコーヒーについてのサンプルの段落から得たものです。日本語の単語の分け方はブラウザーの機能によるため、お使いのブラウザーでは数が少し異なることがあります。
| 設定 | 集計数 | 異なり数 | 上位の結果 |
|---|---|---|---|
| 単語(初期設定) | 90 | 57 | コーヒー 7 (7.8%), の 6 (6.7%), は 5 (5.6%) |
| 単語、最小文字数 2 | 39 | 29 | コーヒー 7 (17.9%), ます 3 (7.7%), です 2 (5.1%) |
| 2語のフレーズ | 81 | 74 | コーヒー は 4 (4.9%), コーヒー の 2 (2.5%), の コーヒー 2 (2.5%) |
1行目では「の」「は」のような助詞が「コーヒー」のすぐ下に並んでいます。よく使われる単語を除外のリストは英単語だけなので、日本語の助詞は除外されません。数える単語の最小文字数を2にすると1文字の助詞が消え、段落が何について書かれているのかが一覧から読み取りやすくなります。ただし「水」「海」のような1文字の名詞も一緒に消える点に注意してください。
英文の場合は、よく使われる単語の除外が役立ちます。除外しないと「the」や「of」が上位を占め、段落の内容が見えにくくなるので、初期設定でオンになっています。
数え方の仕組み
テキストは単語に分割されます。単語とは文字と数字の連続で、アポストロフィやハイフンを含むこともできるので、「it’s」や「well-known」はそれぞれ1語として数えます。カーブしたアポストロフィもまっすぐなものと同じに扱います。単語の前後の句読点は無視されます。
フレーズの場合、ツールはまず文の区切り(ピリオド、疑問符、感嘆符、コロン、セミコロン、かっこ、改行)でテキストを分割します。そのうえで、2語または3語の枠を各部分に沿ってずらしていきます。よく使われる単語を除外がオンの場合、よく使われる単語で始まるか終わるフレーズは飛ばされるので、「roast coffee」は数えられますが「of the」や「the coffee」は数えられません。途中にあるよく使われる単語は残るので、「cup of tea」のようなフレーズは3語の一覧に出てきます。
割合は、テキスト内のすべての単語ではなく、集計数を基準に計算されます。よく使われる単語を除外すると、一覧と総数の両方から除かれます。
コツと注意点
- 語形が違えば別々に数えます。 「bean」と「beans」は2つの項目になり、「run」「runs」「running」も別々です。語形を確実にまとめるには言語ごとの辞書が必要なので、このツールでは語形をまとめません。
- 使いすぎを確認する。 短い記事で、ほかよりずっと多く出てくる普通の単語があれば、見直す価値があります。重複単語チェッカーを使うと、繰り返し使われている各単語がテキストのどこに出てくるかを強調表示で確認できます。
- キーワード出現率。 検索エンジン向けの文章では、2語のフレーズや3語のフレーズを選ぶと、キーフレーズが何回出てくるかがわかります。理想的な割合というものはありません。読み手のために書き、自然に合う場所でフレーズを使ってください。
- 図で見る。 ワードクラウド作成ツールは同じ集計を使い、出現回数の多い単語ほど大きく描きます。
- 文の数も数える。 文の長さ、読了時間、段落の数を調べるには、文数カウンターを使ってください。
- ほかの言語。 アクセント付きの文字を含め、スペースで単語を区切る言語なら集計できます。日本語や中国語のように単語の間にスペースを入れない言語は、ブラウザーの単語分割機能で単語に分けてから集計します。よく使われる単語のリストは英語のみなので、ほかの言語では効果がありません。
単語の出現頻度を数えるほかの方法
Microsoft Word。 Word には頻度一覧の機能はありません。検索(Ctrl+F)を使えば、ナビゲーションウィンドウに表示される結果の件数で、1語ずつ回数を数えられます。
Excel と Google スプレッドシート。 A 列に1行1語で貼り付けます。Google スプレッドシートでは、=QUERY(A:A, "select A, count(A) where A <> '' group by A order by count(A) desc") でランキング表が作れます。Excel では、単語を行と値(集計方法は「個数」)の両方に入れたピボットテーブルで同じことができます。
コード。 Python では、collections.Counter(text.lower().split()).most_common(20) で上位20語を一覧にできますが、単語に句読点が付いたまま残ります。JavaScript では、正規表現でテキストを分割して各単語を Map に追加し、回数で並べ替えます。