텍스트 통계
텍스트문자, 바이트, 단어, 줄, 문장, 단락 수를 다국어 친화적인 단어 분할로 계산합니다.
- 문자 수
- 문자 수(공백 제외)
- 바이트 수(UTF-8)
- 단어 수
- 줄 수
- 문장 수
- 단락 수
- 읽는 시간
이 페이지에서
텍스트 통계 도구란?#
텍스트 통계 도구는 텍스트 블록을 읽고 그 안에 실제로 무엇이 들어있는지 알려 줍니다. 문자가 몇 개, 단어가 몇 개, 문장이 몇 개인지, 바이트로 얼마나 큰지, 독자가 다 읽는 데 대략 얼마나 걸릴지. 이는 한 글자라도 넘치면 걸리는 제한에 부딪히기 전까지는 사소하게 들립니다. 한 글자 초과된 트윗, 160바이트를 조용히 넘기는 메타 설명, 최대 길이가 보이는 문자가 아니라 UTF-8 바이트로 측정되는 입력 필드, “2분 읽기” 배지가 조용히 틀린 초고.
문제는 “단어”가 보편적 개념이 아니라는 것입니다. 영어 단어는 공백으로 구분되지만 중국어·일본어·태국어는 그렇지 않습니다. 你好世界는 네 글자이자 네 단어이되 공백은 보이지 않습니다. 단순한 .split(' ')은 그 문자열 전체를 하나의 “단어”로 보고합니다. 이 도구는 CJK 표의문자·히라가나·가타카나·태국어는 글자별로, 라틴·키릴·그리스·데바나가리·한글은 공백으로 구분된 구간별로 세어 문자 체계 전반에 걸쳐 정직한 단어 수를 제공합니다. 바이트 크기는 실제 UTF-8 인코딩을 사용합니다(string.length가 아님). 서버나 데이터베이스 컬럼이 바이트를 셀 때 중요한 수치입니다.
모든 것은 브라우저에서 동작합니다. 백엔드도 없고 업로드되는 것도 없습니다.
사용 방법#
- 왼쪽 입력 상자에 텍스트를 입력하거나 붙여넣습니다. 이 상자는 모든 문자 체계를 받고 줄바꿈을 보존합니다.
- 숫자가 움직이는 것을 보고 싶기만 하다면 예제 로 준비된 단락을 불러오거나, 지우기 로 상자를 비웁니다.
- 오른쪽 패널을 읽습니다. 8개 행이 입력하는 대로 실시간으로 갱신됩니다.
- 문자 수 — 공백과 줄바꿈 포함 총 코드 단위 수.
- 문자 수(공백 제외) — 모든 공백 문자를 뺀 같은 수.
- 바이트 수(UTF-8) — UTF-8 바이트 길이. 데이터베이스
VARCHAR(n)이나 HTTP 헤더 제한이 실제로 보는 수. - 단어 수 — 문자 체계 인식 카운트(CJK/가나/태국어는 글자별, 나머지는 공백 구분 구간별).
- 줄 수 — 줄바꿈으로 구분된 행.
- 문장 수 — 문자 체계를 가로지르는 종결자로 분할(
.!?더하기 CJK。!?과 아랍어؟۔). - 단락 수 — 빈 줄로 구분된 블록.
- 읽는 시간 — 단어를 ~분당 200단어로 나눈 값, 최소 1분으로 올림.
주요 기능#
- 문자 체계 인식 단어 카운트. CJK 표의문자·히라가나·가타카나·태국어는 각 글자를 한 단어로, 라틴·키릴·그리스·데바나가리·한글은 공백으로 구분된 구간별로 셉니다. 섞인 문장도 깨지지 않고 타당한 합계를 얻습니다.
- 실제 UTF-8 바이트 크기.
你好는 2가 아니라 6바이트입니다. 바이트 카운터는 저장과 전송이 실제로 비용하는 것을 반영합니다. - 문자 체계 간 문장 분할. CJK와 아랍어 종결자를 인식하여
今天天气很好。明天见。는 한 문장이 아니라 두 문장으로 셉니다. - 실시간, 클릭 불필요. 숫자는 키 입력마다 다시 계산됩니다. 잊어버릴 생성 단계가 없습니다.
- 기기 안에 머무름. 붙여넣은 텍스트는 페이지를 떠나지 않습니다. 요청, 로그, 백엔드가 없습니다.
사용 예#
고전 팬그램을 붙여넣습니다.
The quick brown fox jumps over the lazy dog.
패널은 다음을 보고합니다.
- 문자 수: 44(마침표와 8개 공백 포함)
- 문자 수(공백 제외): 36
- 바이트 수: 44(모든 문자가 ASCII이므로 바이트가 문자와 같음)
- 단어 수: 9
- 줄 수: 1
- 문장 수: 1
- 단락 수: 1
- 읽는 시간: 1분(9단어는 200보다 훨씬 적지만, 의미 없는 “0분”이 표시되지 않도록 카운터가 최소 1분으로 내림)
중국어 문장 你好世界。로 바꾸면 단어 수는 4(한자당 하나)가 되고 바이트는 13으로 뜁니다. 3바이트 글자 4개와 1바이트 마침표. 이 “글자 수 4”와 “바이트 수 13” 사이의 간극이 바로 이 도구가 폼 제출이 밟기 전에 드러내기 위해 존재하는 종류의 놀라움입니다.
FAQ#
바이트 수가 문자 수보다 훨씬 큰 이유는?#
UTF-8이 비 ASCII 문자를 여러 바이트로 인코딩하기 때문입니다. 기본 라틴 범위는 1바이트, 라틴 확장(à, ñ, ç)은 2바이트, 대부분의 CJK 표의문자와 인도 계열은 3바이트, 이모지와 보충 평면은 4바이트. 바이트 예산을 강제하는 폼과 데이터베이스는 더 큰 수를 보므로, 이 도구도 같은 방식으로 바이트를 보고합니다.
중국어 텍스트의 단어 수가 높게 느껴집니다. 맞나요?#
아마 맞을 것입니다. CJK 문자 체계는 공백으로 단어를 구분하지 않으므로 글자별 카운트가 재현 가능한 관행적 측정법이며, 대부분의 편집기와 워드프로세서가 CJK 길이를 보고하는 방식과도 일치합니다. 글자 카운트가 아니라 언어적 단어 분할이 필요하다면 /en/text/word-frequency/ 도구의 CJK 모드가 브라우저의 세그멘터로 실제 단어 경계에서 분할합니다.
”읽는 시간”은 어떤 읽기 속도를 가정하나요?#
분당 약 200단어로, 일반 산문을 조용히 읽는 성인의 널리 쓰이는 평균입니다. 대략적인 추정입니다. 기술 콘텐츠, 코드, 외국어는 더 느릴 것입니다. 값은 항상 최소 1분으로 올림되어 짧은 조각이 의미 없는 “0분”을 표시하지 않습니다.
코드 조각의 단어도 산문과 같은 방식으로 세나요?#
네. getUserById 같은 식별자는 안에 공백이나 구두점이 없으므로 하나의 토큰으로 취급됩니다. getUserById를 세 단어로 세고 싶다면 먼저 /en/text/transform/ 도구의 케이스 분할기로 통과시키세요.