단어 빈도 분석으로 알 수 있는 것
단어 빈도 분석 도구는 글에서 각 단어가 몇 번 나오는지 셉니다. 결과는 순위 목록입니다. 가장 많이 쓴 단어가 맨 위에 오고, 그다음 단어가 이어지며, 한 번만 나온 단어까지 내려갑니다.
이 목록은 생각보다 쓸모가 많습니다. 글 쓰는 사람은 지나치게 자주 쓰는 단어를 잡아낼 수 있습니다. 학생은 연설문이나 소설의 어휘를 공부할 때 씁니다. 검색 엔진용 글을 쓰는 사람은 핵심 키워드가 몇 번 나오는지 확인합니다. 연구자는 설문 응답이나 인터뷰 기록을 처음 훑어볼 때 활용합니다.
사용 방법
- 텍스트 입력에 글을 붙여넣습니다. 처음에는 작동 방식을 볼 수 있도록 커피에 관한 짧은 한국어 문단이 들어 있습니다.
- 세는 단위에서 단어, 두 단어 구, 세 단어 구 중 하나를 고릅니다.
- 옵션을 고릅니다.
- 흔한 단어 제외(기본으로 켜짐)는 “the”, “and”, “of” 같은 영어 단어를 뺍니다.
- 대소문자 무시(기본으로 켜짐)는 “Coffee”와 “coffee”를 같은 단어로 셉니다.
- 숫자 포함(기본으로 꺼짐)은 2024 같은 숫자도 단어로 셉니다.
- 짧은 단어를 건너뛰려면 최소 단어 길이 (글자)를 정합니다. 4로 정하면 세 글자 이하의 단어는 모두 빠집니다.
- 표를 읽습니다. #은 순위, 횟수는 해당 항목이 나온 횟수, 비율은 그 백분율입니다.
- 복사를 누르면 목록이 탭으로 구분된 세 열로 복사되고, CSV를 누르면 Excel이나 Google 스프레드시트용 파일을 내려받습니다.
표 위의 집계 수는 포함된 단어 또는 구의 전체 수, 서로 다른 항목은 고유한 항목 수, 최다 항목은 가장 많이 나온 항목입니다.
예시
아래 결과는 도구에 처음 들어 있는 예시 문단에서 나온 것입니다.
| 설정 | 집계 수 | 서로 다른 항목 | 상위 결과 |
|---|---|---|---|
| 단어 | 50 | 44 | 커피 5 (10.0%), 볶은 2 (4.0%), 원두는 2 (4.0%) |
| 두 단어 구 | 45 | 43 | 볶은 커피 2 (4.4%), 커피 원두는 2 (4.4%) |
| 세 단어 구 | 40 | 39 | 볶은 커피 원두는 2 (5.0%) |
“커피” 5회에는 “커피 열매”, “커피 원두”처럼 띄어 쓴 경우만 들어가고, “커피는”과 “커피를”은 따로 1회씩 셉니다. 예시 문단은 한국어라서 흔한 단어 제외를 켜든 끄든 결과가 같습니다. 이 옵션이 빼는 단어는 “the”, “and”, “of” 같은 영어 단어뿐이기 때문입니다. 영어 글에서는 이 옵션이 기본으로 켜져 있어야 하는 이유가 분명합니다. 끄면 “the” 같은 단어가 목록 맨 위를 차지해 글의 실제 내용을 덜 알려 줍니다.
한국어 텍스트를 넣으면
한국어도 띄어쓰기로 단어를 나누므로 바로 셀 수 있습니다. 다만 단어는 띄어쓰기 단위인 어절이라서 조사가 붙은 형태가 따로 집계됩니다. 아래는 이 페이지의 코드로 실제로 센 결과입니다.
| 텍스트 | 설정 | 결과 |
|---|---|---|
| 데이터 분석, 데이터 시각화, 데이터 분석 도구. 2026년 데이터 | 단어 | 데이터 4 (44.4%), 분석 2 (22.2%), 2026년 1 (11.1%), 도구 1 (11.1%), 시각화 1 (11.1%) |
| 데이터 분석, 데이터 시각화, 데이터 분석 도구. 2026년 데이터 | 두 단어 구 | 데이터 분석 2 (28.6%), 2026년 데이터 1 (14.3%), 데이터 시각화 1 (14.3%) 등 |
| 커피는 아침에 마십니다. 커피를 좋아합니다. 오늘도 커피 한 잔과 커피 원두를 샀습니다. 원두 커피가 좋습니다. | 단어 | 커피 2 (13.3%), 그 밖에 커피는, 커피를, 커피가, 원두, 원두를 등이 각 1회 |
세 번째 예시처럼 “커피”, “커피는”, “커피를”, “커피가”는 모두 다른 항목입니다. 형태소 분석으로 조사를 떼어 내지 않기 때문입니다. “2026년”은 글자 “년”이 붙어 있어 숫자 포함을 꺼도 단어로 셉니다. 한글은 음절 하나를 1글자로 보므로 최소 단어 길이를 2로 정하면 “한” 같은 한 글자 어절이 빠집니다. 쉼표는 구를 끊지 않으므로 두 단어 구에는 “분석 데이터”처럼 쉼표를 사이에 둔 조합도 들어갑니다.
세는 방식
텍스트를 먼저 단어로 나눕니다. 단어는 글자와 숫자가 이어진 덩어리이며 아포스트로피나 하이픈을 포함할 수 있어서 “it’s”와 “well-known”은 각각 한 단어입니다. 둥근 아포스트로피는 곧은 아포스트로피와 같게 처리합니다. 단어 주변의 문장 부호는 무시합니다.
구를 셀 때는 먼저 마침표, 물음표, 느낌표, 콜론, 세미콜론, 괄호, 줄바꿈 같은 문장 경계에서 텍스트를 나눕니다. 그다음 각 조각을 따라 두 단어 또는 세 단어 크기의 창을 한 칸씩 옮기며 셉니다. 흔한 단어 제외를 켜면 흔한 단어로 시작하거나 끝나는 구는 건너뛰므로 “roast coffee”는 나오지만 “of the”나 “the coffee”는 나오지 않습니다. 가운데에 있는 흔한 단어는 그대로 두기 때문에 “cup of tea” 같은 구는 세 단어 구 목록에 나옵니다.
비율은 텍스트 전체 단어 수가 아니라 집계 수를 기준으로 계산합니다. 흔한 단어를 제외하면 그 단어들은 목록과 전체 수 양쪽에서 모두 빠집니다.
팁과 한계
- 형태가 다르면 따로 셉니다. “bean”과 “beans”는 서로 다른 항목이고, “run”, “runs”, “running”도 마찬가지입니다. 한국어의 “커피는”, “커피를”도 같습니다. 단어 형태를 믿을 만하게 합치려면 언어마다 사전이 필요하기 때문에 이 도구는 형태를 합치지 않습니다.
- 과다 사용을 확인하세요. 짧은 글에서 평범한 단어 하나가 다른 단어보다 훨씬 자주 나온다면 다시 볼 만합니다. 중복 단어 찾기는 반복된 단어를 본문에서 강조해 어디에 나오는지 보여 줍니다.
- 키워드 밀도. 검색 엔진용 글이라면 두 단어 구나 세 단어 구를 골라 핵심 구가 몇 번 나오는지 확인하세요. 이상적인 비율은 없습니다. 독자를 위해 쓰고, 자연스러운 곳에만 키워드를 넣으세요.
- 그림으로 보기. 워드 클라우드 만들기 도구는 같은 집계를 바탕으로 자주 나온 단어를 크게 그립니다.
- 문장도 세어 보기. 문장 길이, 읽기 시간, 문단 수는 글자수 세기 도구에서 확인할 수 있습니다.
- 다른 언어. 악센트가 있는 글자를 포함해 띄어쓰기로 단어를 나누는 언어라면 모두 셀 수 있습니다. 흔한 단어 목록은 영어 전용이라 한국어 단어에는 영향을 주지 않습니다. 다른 언어의 글이라면 꺼 두는 편이 안전합니다.
다른 방법으로 단어 빈도 세기
Microsoft Word. Word에는 빈도 목록 기능이 없습니다. 찾기(Ctrl+F)로 한 단어씩 셀 수 있으며, 탐색 창에 결과 개수가 표시됩니다.
Excel과 Google 스프레드시트. A열에 한 행에 한 단어씩 붙여넣습니다. Google 스프레드시트에서는 =QUERY(A:A, "select A, count(A) where A <> '' group by A order by count(A) desc")로 순위 표를 만들 수 있습니다. Excel에서는 단어를 행과 값(개수로 설정)에 모두 넣은 피벗 테이블로 같은 결과를 얻습니다.
코드. Python에서는 collections.Counter(text.lower().split()).most_common(20)으로 상위 20개 단어를 볼 수 있지만, 단어에 붙은 문장 부호까지 함께 셉니다. JavaScript에서는 정규 표현식으로 텍스트를 나눠 각 단어를 Map에 더한 뒤 횟수로 정렬하면 됩니다.