टेक्स्ट सांख्यिकी
टेक्स्टबहुभाषी-अनुकूल शब्द विभाजन के साथ अक्षर, बाइट्स, शब्द, पंक्तियाँ, वाक्य व पैराग्राफ़ गिनें।
- अक्षर
- अक्षर (रिक्त स्थान रहित)
- बाइट्स (UTF-8)
- शब्द
- पंक्तियाँ
- वाक्य
- पैराग्राफ़
- पठन समय
इस पृष्ठ पर
टेक्स्ट सांख्यिकी टूल क्या है?#
एक टेक्स्ट सांख्यिकी टूल पाठ का एक ब्लॉक पढ़ता है और बताता है कि वास्तव में उसके अंदर क्या है: कितने अक्षर, कितने शब्द, कितने वाक्य, बाइट्स में कितना बड़ा, और लगभग कितना समय लेगा कि कोई पाठक इसे पूरा करे। यह तुच्छ सुनाई देता है जब तक आप किसी ऐसी सीमा से न टकराएँ जो दंश दे — एक ट्वीट जो एक अक्षर अधिक है, एक meta description जो चुपचाप 160 बाइट से अधिक हो जाता है, एक इनपुट फ़ील्ड जिसकी maxlength दृश्यमान अक्षरों के बजाय UTF-8 बाइट्स में मापी जाती है, या एक ड्राफ़्ट जिसका “2 मिनट पठन” बैज चुपचाप गलत है।
मुश्किल यह है कि “एक शब्द” सार्वभौमिक अवधारणा नहीं है। अंग्रेज़ी शब्द रिक्ति से अलग होते हैं, किंतु चीनी, जापानी और थाई नहीं — 你好世界 चार अक्षर और चार शब्द हैं, बीच में कोई रिक्ति नहीं। एक साधारण .split(' ') उस पूरी स्ट्रिंग के लिए एक “शब्द” रिपोर्ट करता है। यह टूल CJK भावचित्रों, hiragana, katakana और थाई के लिए प्रति-अक्षर गिनता है, और लातीनी, सिरिलिक, यूनानी, देवनागरी और हांगुल के लिए रिक्ति-पृथक रन द्वारा, ताकि शब्द गणना लिपियों में सच्ची हो। बाइट आकार वास्तविक UTF-8 एन्कोडिंग उपयोग करता है (string.length नहीं), जो तब मायने रखता है जब कोई सर्वर या डेटाबेस कॉलम बाइट्स गिनता है।
सब कुछ आपके ब्राउज़र में चलता है — कोई बैकएंड नहीं और कुछ भी अपलोड नहीं होता।
इसका उपयोग कैसे करें#
- बाईं ओर इनपुट बॉक्स में अपना टेक्स्ट टाइप करें या चिपकाएँ। बॉक्स किसी भी लिपि को स्वीकार करता है और नई पंक्तियाँ संरक्षित रखता है।
- यदि आप केवल संख्याएँ चलते देखना चाहते हैं तो नमूना क्लिक करें, या बॉक्स खाली करने के लिए साफ़ करें।
- दायाँ पैनल पढ़ें। आप टाइप करते ही आठ पंक्तियाँ लाइव अद्यतन होती हैं:
- अक्षर — कुल कोड-इकाई गिनती, रिक्ति और नई पंक्तियाँ सहित।
- अक्षर (रिक्त स्थान रहित) — वही, हर रिक्ति अक्षर घटाकर।
- बाइट्स — UTF-8 बाइट लंबाई, वह संख्या जो डेटाबेस
VARCHAR(n)या HTTP शीर्षक सीमा वास्तव में देखती है। - शब्द — लिपि-जागरूक गिनती (CJK/kana/थाई प्रति अक्षर, बाकी रिक्ति-पृथक रन द्वारा)।
- पंक्तियाँ — नई-पंक्ति से अलग पंक्तियाँ।
- वाक्य — लिपियों में समापक पर विभाजन (
.!?साथ ही CJK。!?और अरबी؟۔)। - पैराग्राफ़ — खाली पंक्ति से अलग ब्लॉक।
- पठन समय — शब्दों को ~200 शब्द प्रति मिनट से विभाजित, कम से कम एक मिनट तक राउंड।
मुख्य विशेषताएँ#
- लिपि-जागरूक शब्द गणना। CJK भावचित्र, hiragana, katakana और थाई प्रत्येक प्रति-अक्षर एक शब्द गिने जाते हैं; लातीनी, सिरिलिक, यूनानी, देवनागरी और हांगुल रिक्ति-पृथक रन द्वारा गिने जाते हैं। एक मिश्रित वाक्य समझदारी कुल देता है, टूटा नहीं।
- वास्तविक UTF-8 बाइट आकार।
你好6 बाइट है, 2 नहीं — बाइट काउंटर वही दर्शाता है जो भंडारण और परिवहन वास्तव में खर्च करते हैं। - क्रॉस-लिपि वाक्य विभाजन। CJK और अरबी समापक पहचानता है, इसलिए
今天天气很好。明天见。दो वाक्य गिना जाता है, एक नहीं। - लाइव, कोई क्लिक आवश्यक नहीं। संख्याएँ हर कीस्ट्रोक पर पुनः गणना करती हैं; कोई उत्पन्न कदम नहीं है जो भूल जाए।
- आपकी मशीन पर रहता है। चिपकाया गया पाठ कभी पेज नहीं छोड़ता — कोई अनुरोध नहीं, कोई लॉग नहीं, कोई बैकएंड नहीं।
विस्तृत उदाहरण#
क्लासिक pangram चिपकाएँ:
The quick brown fox jumps over the lazy dog.
पैनल रिपोर्ट करता है:
- अक्षर: 44 (पीरियड और 8 रिक्तियाँ सहित)
- अक्षर (रिक्त स्थान रहित): 36
- बाइट्स: 44 (हर अक्षर ASCII है, इसलिए बाइट्स यहाँ अक्षरों के बराबर हैं)
- शब्द: 9
- पंक्तियाँ: 1
- वाक्य: 1
- पैराग्राफ़: 1
- पठन समय: 1 मिनट (9 शब्द 200 से बहुत कम हैं, किंतु काउंटर एक मिनट तक फ़्लोर करता है ताकि कोई खाली “0 मि०” कभी न दिखे)
चीनी वाक्य 你好世界。 से बदलें और शब्द गिनती 4 हो जाती है (प्रत्येक Han अक्षर पर एक), जबकि बाइट्स 13 तक कूदते हैं — चार 3-बाइट अक्षर और 1-बाइट पूर्ण विराम। “4 अक्षर” और “13 बाइट्स” के बीच का यही अंतर ठीक वही आश्चर्य है जो यह टूल किसी फ़ॉर्म सबमिशन से पहले सामने लाने के लिए मौजूद है।
अक्सर पूछे जाने वाले प्रश्न#
मेरी बाइट गिनती मेरी अक्षर गिनती से बहुत बड़ी क्यों है?#
क्योंकि UTF-8 ग़ैर-ASCII अक्षरों को कई बाइट्स से एन्कोड करता है: मूल लातीनी श्रेणी के लिए एक बाइट, लातीनी विस्तारित (à, ñ, ç) के लिए दो, अधिकांश CJK भावचित्रों और भारतीय लिपियों के लिए तीन, और इमोजी तथा अधर तल के लिए चार। फ़ॉर्म और डेटाबेस जो बाइट बजट लागू करते हैं वे बड़ी संख्या देखते हैं, इसलिए यह टूल बाइट्स उसी तरह रिपोर्ट करता है।
मेरे चीनी पाठ के लिए शब्द गिनती अधिक महसूस होती है। क्या यह सही है?#
संभवतः। CJK लिपियाँ शब्दों को रिक्ति से अलग नहीं करतीं, इसलिए प्रति-अक्षर गिनती उन्हें मापने का पारंपरिक, पुनरुत्पादनीय तरीका है — और यह अधिकांश संपादकों और वर्ड प्रोसेसरों द्वारा CJK लंबाई रिपोर्ट करने से मेल खाता है। यदि आपको अक्षर गिनती के बजाय भाषाई शब्द विभाजन चाहिए, तो /en/text/word-frequency/ टूल का CJK मोड वास्तविक शब्द सीमाओं पर विभाजित करने के लिए ब्राउज़र के segmenter का उपयोग करता है।
“पठन समय” किस पठन गति को मानता है?#
लगभग 200 शब्द प्रति मिनट, सादे गद्य के वयस्क मौन पठन के लिए व्यापक रूप से उपयोग किया जाने वाला औसत। यह एक अशुद्ध अनुमान है — तकनीकी सामग्री, कोड, या विदेशी भाषा धीमी होगी। मान हमेशा कम से कम एक मिनट तक राउंड किया जाता है ताकि एक छोटे स्निपेट पर अर्थहीन “0 मिनट” न दिखे।
क्या यह कोड स्निपेट में शब्दों को गद्य की तरह ही गिनता है?#
हाँ — getUserById जैसे पहचानकर्ता एक टोकन माने जाते हैं क्योंकि उनके भीतर कोई रिक्ति या विराम चिह्न नहीं है। यदि आप getUserById को तीन शब्दों में गिनना चाहते हैं, तो इसे /en/text/transform/ टूल के केस विभाजक से पहले चलाएँ।