टूल
गाइड

टेक्स्ट सांख्यिकी

टेक्स्ट

बहुभाषी-अनुकूल शब्द विभाजन के साथ अक्षर, बाइट्स, शब्द, पंक्तियाँ, वाक्य व पैराग्राफ़ गिनें।

100% क्लाइंट-साइड कोई बैकएंड नहीं
अक्षर
अक्षर (रिक्त स्थान रहित)
बाइट्स (UTF-8)
शब्द
पंक्तियाँ
वाक्य
पैराग्राफ़
पठन समय
इस पृष्ठ पर

टेक्स्ट सांख्यिकी टूल क्या है?#

एक टेक्स्ट सांख्यिकी टूल पाठ का एक ब्लॉक पढ़ता है और बताता है कि वास्तव में उसके अंदर क्या है: कितने अक्षर, कितने शब्द, कितने वाक्य, बाइट्स में कितना बड़ा, और लगभग कितना समय लेगा कि कोई पाठक इसे पूरा करे। यह तुच्छ सुनाई देता है जब तक आप किसी ऐसी सीमा से न टकराएँ जो दंश दे — एक ट्वीट जो एक अक्षर अधिक है, एक meta description जो चुपचाप 160 बाइट से अधिक हो जाता है, एक इनपुट फ़ील्ड जिसकी maxlength दृश्यमान अक्षरों के बजाय UTF-8 बाइट्स में मापी जाती है, या एक ड्राफ़्ट जिसका “2 मिनट पठन” बैज चुपचाप गलत है।

मुश्किल यह है कि “एक शब्द” सार्वभौमिक अवधारणा नहीं है। अंग्रेज़ी शब्द रिक्ति से अलग होते हैं, किंतु चीनी, जापानी और थाई नहीं — 你好世界 चार अक्षर और चार शब्द हैं, बीच में कोई रिक्ति नहीं। एक साधारण .split(' ') उस पूरी स्ट्रिंग के लिए एक “शब्द” रिपोर्ट करता है। यह टूल CJK भावचित्रों, hiragana, katakana और थाई के लिए प्रति-अक्षर गिनता है, और लातीनी, सिरिलिक, यूनानी, देवनागरी और हांगुल के लिए रिक्ति-पृथक रन द्वारा, ताकि शब्द गणना लिपियों में सच्ची हो। बाइट आकार वास्तविक UTF-8 एन्कोडिंग उपयोग करता है (string.length नहीं), जो तब मायने रखता है जब कोई सर्वर या डेटाबेस कॉलम बाइट्स गिनता है।

सब कुछ आपके ब्राउज़र में चलता है — कोई बैकएंड नहीं और कुछ भी अपलोड नहीं होता।

इसका उपयोग कैसे करें#

  1. बाईं ओर इनपुट बॉक्स में अपना टेक्स्ट टाइप करें या चिपकाएँ। बॉक्स किसी भी लिपि को स्वीकार करता है और नई पंक्तियाँ संरक्षित रखता है।
  2. यदि आप केवल संख्याएँ चलते देखना चाहते हैं तो नमूना क्लिक करें, या बॉक्स खाली करने के लिए साफ़ करें
  3. दायाँ पैनल पढ़ें। आप टाइप करते ही आठ पंक्तियाँ लाइव अद्यतन होती हैं:
    • अक्षर — कुल कोड-इकाई गिनती, रिक्ति और नई पंक्तियाँ सहित।
    • अक्षर (रिक्त स्थान रहित) — वही, हर रिक्ति अक्षर घटाकर।
    • बाइट्स — UTF-8 बाइट लंबाई, वह संख्या जो डेटाबेस VARCHAR(n) या HTTP शीर्षक सीमा वास्तव में देखती है।
    • शब्द — लिपि-जागरूक गिनती (CJK/kana/थाई प्रति अक्षर, बाकी रिक्ति-पृथक रन द्वारा)।
    • पंक्तियाँ — नई-पंक्ति से अलग पंक्तियाँ।
    • वाक्य — लिपियों में समापक पर विभाजन (. ! ? साथ ही CJK 。!? और अरबी ؟۔)।
    • पैराग्राफ़ — खाली पंक्ति से अलग ब्लॉक।
    • पठन समय — शब्दों को ~200 शब्द प्रति मिनट से विभाजित, कम से कम एक मिनट तक राउंड।

मुख्य विशेषताएँ#

  • लिपि-जागरूक शब्द गणना। CJK भावचित्र, hiragana, katakana और थाई प्रत्येक प्रति-अक्षर एक शब्द गिने जाते हैं; लातीनी, सिरिलिक, यूनानी, देवनागरी और हांगुल रिक्ति-पृथक रन द्वारा गिने जाते हैं। एक मिश्रित वाक्य समझदारी कुल देता है, टूटा नहीं।
  • वास्तविक UTF-8 बाइट आकार। 你好 6 बाइट है, 2 नहीं — बाइट काउंटर वही दर्शाता है जो भंडारण और परिवहन वास्तव में खर्च करते हैं।
  • क्रॉस-लिपि वाक्य विभाजन। CJK और अरबी समापक पहचानता है, इसलिए 今天天气很好。明天见。 दो वाक्य गिना जाता है, एक नहीं।
  • लाइव, कोई क्लिक आवश्यक नहीं। संख्याएँ हर कीस्ट्रोक पर पुनः गणना करती हैं; कोई उत्पन्न कदम नहीं है जो भूल जाए।
  • आपकी मशीन पर रहता है। चिपकाया गया पाठ कभी पेज नहीं छोड़ता — कोई अनुरोध नहीं, कोई लॉग नहीं, कोई बैकएंड नहीं।

विस्तृत उदाहरण#

क्लासिक pangram चिपकाएँ:

The quick brown fox jumps over the lazy dog.

पैनल रिपोर्ट करता है:

  • अक्षर: 44 (पीरियड और 8 रिक्तियाँ सहित)
  • अक्षर (रिक्त स्थान रहित): 36
  • बाइट्स: 44 (हर अक्षर ASCII है, इसलिए बाइट्स यहाँ अक्षरों के बराबर हैं)
  • शब्द: 9
  • पंक्तियाँ: 1
  • वाक्य: 1
  • पैराग्राफ़: 1
  • पठन समय: 1 मिनट (9 शब्द 200 से बहुत कम हैं, किंतु काउंटर एक मिनट तक फ़्लोर करता है ताकि कोई खाली “0 मि०” कभी न दिखे)

चीनी वाक्य 你好世界。 से बदलें और शब्द गिनती 4 हो जाती है (प्रत्येक Han अक्षर पर एक), जबकि बाइट्स 13 तक कूदते हैं — चार 3-बाइट अक्षर और 1-बाइट पूर्ण विराम। “4 अक्षर” और “13 बाइट्स” के बीच का यही अंतर ठीक वही आश्चर्य है जो यह टूल किसी फ़ॉर्म सबमिशन से पहले सामने लाने के लिए मौजूद है।

अक्सर पूछे जाने वाले प्रश्न#

मेरी बाइट गिनती मेरी अक्षर गिनती से बहुत बड़ी क्यों है?#

क्योंकि UTF-8 ग़ैर-ASCII अक्षरों को कई बाइट्स से एन्कोड करता है: मूल लातीनी श्रेणी के लिए एक बाइट, लातीनी विस्तारित (à, ñ, ç) के लिए दो, अधिकांश CJK भावचित्रों और भारतीय लिपियों के लिए तीन, और इमोजी तथा अधर तल के लिए चार। फ़ॉर्म और डेटाबेस जो बाइट बजट लागू करते हैं वे बड़ी संख्या देखते हैं, इसलिए यह टूल बाइट्स उसी तरह रिपोर्ट करता है।

मेरे चीनी पाठ के लिए शब्द गिनती अधिक महसूस होती है। क्या यह सही है?#

संभवतः। CJK लिपियाँ शब्दों को रिक्ति से अलग नहीं करतीं, इसलिए प्रति-अक्षर गिनती उन्हें मापने का पारंपरिक, पुनरुत्पादनीय तरीका है — और यह अधिकांश संपादकों और वर्ड प्रोसेसरों द्वारा CJK लंबाई रिपोर्ट करने से मेल खाता है। यदि आपको अक्षर गिनती के बजाय भाषाई शब्द विभाजन चाहिए, तो /en/text/word-frequency/ टूल का CJK मोड वास्तविक शब्द सीमाओं पर विभाजित करने के लिए ब्राउज़र के segmenter का उपयोग करता है।

“पठन समय” किस पठन गति को मानता है?#

लगभग 200 शब्द प्रति मिनट, सादे गद्य के वयस्क मौन पठन के लिए व्यापक रूप से उपयोग किया जाने वाला औसत। यह एक अशुद्ध अनुमान है — तकनीकी सामग्री, कोड, या विदेशी भाषा धीमी होगी। मान हमेशा कम से कम एक मिनट तक राउंड किया जाता है ताकि एक छोटे स्निपेट पर अर्थहीन “0 मिनट” न दिखे।

क्या यह कोड स्निपेट में शब्दों को गद्य की तरह ही गिनता है?#

हाँ — getUserById जैसे पहचानकर्ता एक टोकन माने जाते हैं क्योंकि उनके भीतर कोई रिक्ति या विराम चिह्न नहीं है। यदि आप getUserById को तीन शब्दों में गिनना चाहते हैं, तो इसे /en/text/transform/ टूल के केस विभाजक से पहले चलाएँ।