إحصائيات النص
النصعدّ الأحرف والبايتات والكلمات والأسطر والجمل والفقرات مع تقسيم كلمات يدعم عدة لغات.
- الأحرف
- الأحرف (بدون مسافات)
- البايتات (UTF-8)
- الكلمات
- الأسطر
- الجمل
- الفقرات
- زمن القراءة
في هذه الصفحة
ما هي أداة إحصائيات النص؟#
تقرأ أداة إحصائيات النص كتلةً نصية وتخبرك بما في داخلها فعلًا: كم حرفًا، وكم كلمة، وكم جملة، وكم حجمها بالبايتات، وكم تقريبًا سيستغرق القارئ لإنهائها. يبدو هذا تافهًا حتى تصطدم بحدّ يَعَضّ — تغريدة تتجاوز بحرف واحد، أووصف وصفي (meta) يتجاوز 160 بايت بصمت، أومرجع إدخال maxlength يُقاس بالبايتات UTF-8 لا بالأحرف المرئية، أمسوّدة شارتها «قراءة دقيقتان» خاطئة بصمت.
المشكلة أنّ «الكلمة» ليست مفهومًا كونيًّا. الكلمات الإنجليزية مفصولة بمسافات، لكن الصينية واليابانية والتايلاندية ليست كذلك — فالسلسلة 你好世界 أربعة أحرف وأربع كلمات، بلا مسافة قط. يُبلغ .split(' ') الساذج عن «كلمة» واحدة لتلك السلسلة بأكملها. تَعُدّ هذه الأداة لكل حرف بالنسبة لإيديوغرافات CJK والهيراغانا والكاتاكانا والتايلاندية، وبأجزاء مفصولة بالمسافات بالنسبة للاتينية والسيريلية واليونانية والديفاناغارية والهانغول، فيكون عدد الكلمات صادقًا عبر الكتابات. ويستخدم حجم البايت ترميز UTF-8 حقيقيًّا (لا string.length)، وهو ما يهمّ حين يَعُدّ خادم أوعمود قاعدة بيانات البايتات.
كل شيء يجري في متصفّحك — لا خادم خلفي ولا شيء يُرفع.
كيفية الاستخدام#
- اكتب أو الصق نصّك في مربع الإدخال على اليسار. يقبل المربع أيّ كتابة ويحفظ الأسطر الجديدة.
- اضغط مثال لتحميل مقطع جاهز إن أردت فقط رؤية الأرقام تتحرك، أومسح لإفراغ المربع.
- اقرأ اللوحة اليمنى. ثمانية صفوف تتحدّث حيًّا أثناء الكتابة:
- الأحرف — إجمالي عدد وحدات الشيفرة، شاملةً المسافات والأسطر الجديدة.
- الأحرف (بدون مسافات) — ذاته ناقص كل محرف مسافة.
- البايتات (UTF-8) — طول البايت بترميز UTF-8، الرقم الذي تراه قاعدة البيانات
VARCHAR(n)أوحدّ ترويسة HTTP فعلًا. - الكلمات — عدّ يراعي الكتابة (CJK/kana/التايلاندية لكل حرف، كل ما سواها بأجزاء مفصولة بالمسافات).
- الأسطر — صفوف مفصولة بسطر جديد.
- الجمل — تقسيم على علامات النهاية عبر الكتابات (
.و!و?بالإضافة إلى。!?الخاصة بـCJK و؟۔العربية). - الفقرات — كتل مفصولة بسطر فارغ.
- زمن القراءة — الكلمات مقسومة على نحو ~200 كلمة في الدقيقة، مقرَّبة لأعلى إلى دقيقة واحدة على الأقل.
الميزات الرئيسية#
- عدّ كلمات يراعي الكتابة. إيديوغرافات CJK والهيراغانا والكاتاكانا والتايلاندية يُعَدّ كل منها كلمةً لكل حرف؛ والاتينية والسيريلية واليونانية والديفاناغارية والهانغول تُعَدّ بأجزاء مفصولة بالمسافات. جملة مختلطة تحصل على إجمالي محسوس لا مكسور.
- حجم بايت UTF-8 حقيقي.
你好6 بايتات لا 2 — يعكس عدّاد البايتات ما تكلفه التخزين والنقل فعلًا. - تقسيم جمل عبر الكتابات. يتعرّف على علامات نهاية CJK والعربية، فتُعَدّ
今天天气很好。明天见。جملتَين لا واحدة. - حيّ، بلا حاجة لنقر. تُعاد الأرقام حسابها مع كل ضغطة مفتاح؛ لا خطوة «توليد» تُنسى.
- يبقى على جهازك. النصّ الملصق لا يغادر الصفحة قط — بلا طلب ولا سجلّ ولا خادم خلفي.
مثال عملي#
الصق الجنغرام الكلاسيكي:
The quick brown fox jumps over the lazy dog.
تُبلغ اللوحة:
- الأحرف: 44 (تشمل النقطة و8 مسافات)
- الأحرف (بدون مسافات): 36
- البايتات: 44 (كل محرف ASCII، فتساوي البايتات الأحرف هنا)
- الكلمات: 9
- الأسطر: 1
- الجمل: 1
- الفقرات: 1
- زمن القراءة: 1 دقيقة (9 كلمات أقل بكثير من 200، لكن العدّاد يَضبُط إلى دقيقة واحدة فلا تظهر «0 دقيقة» فارغة أبدًا)
بدّل إلى الجملة الصينية 你好世界。 فيصبح عدد الكلمات 4 (واحدة لكل حرف Han)، بينما تقفز البايتات إلى 13 — أربعة أحرف 3-بايت بالإضافة إلى النقطة الكاملة 1-بايت. تلك الفجوة بين «4 أحرف» و«13 بايت» هي بالضبط نوع المفاجأة التي وُجدت هذه الأداة لكشفها قبل أن يفعلها إرسال نموذج.
الأسئلة الشائعة#
لماذا عدد البايتات أكبر بكثير من عدد الأحرف؟#
لأنّ UTF-8 يُرمِّز المحارف غير-ASCII بعدّة بايتات: بايت واحد للنطاق اللاتيني الأساسي، واثنان للاتيني الموسَّع (à وñ وç)، وثلاثة لمعظم إيديوغرافات CJK والكتابات الهندية، وأربعة للرموز التعبيرية والمستوى الفلكي. النماذج وقواعد البيانات التي تُطبّق ميزانية بايت ترى الرقم الأكبر، فتُبلغ هذه الأداة عن البايتات بالطريقة ذاتها.
عدد كلمات نصّي الصيني يبدو مرتفعًا. هل هذا صحيح؟#
على الأرجح. كتابات CJK لا تفصل الكلمات بمسافات، فالعدّ لكل حرف هو الطريقة المُعتادة القابلة للتكرار لقياسها — وهو يطابق كيف يُبلغ أغلب المحرّرات ومعالجات النصوص عن طول CJK. إن احتجت تجزئة كلمات لغوية بدلًا من عدّ الأحرف، فإنّ وضع CJK في أداة /en/text/word-frequency/ يستخدم مُجزِّئ المتصفّح للتقسيم على حدود الكلمات الفعلية.
أيّ سرعة قراءة يفترض «زمن القراءة»؟#
نحو 200 كلمة في الدقيقة، متوسط مستخدَم على نطاق واسع للقراءة الصامتة للبالغين للنثر المجرّد. هو تقدير تقريبي — المحتوى التقني والشيفرات واللغة الأجنبية ستكون أبطأ. تُقرَّب القيمة دائمًا لأعلى إلى دقيقة واحدة على الأقل حتى لا تُظهر المقتطفات القصيرة «0 دقائق» بلا معنى.
هل تَعُدّ الكلمات في مقطع شيفرة كما تَعُدّها في النثر؟#
نعم — المُعرِّفات مثل getUserById تُعامَل كرمز واحد لأنّه لا مسافة أوترقيم بداخلها. إن أردت أن يُعَدّ getUserById ثلاث كلمات، مرّره عبر تقسيم الحالات في أداة /en/text/transform/ أولًا.