Werkzeuge
Leitfäden

Textstatistik

Text

Zählt Zeichen, Bytes, Wörter, Zeilen, Sätze und Absätze mit mehrsprachenfreundlicher Worttrennung.

100 % clientseitig Ohne Backend
Zeichen
Zeichen (ohne Leerzeichen)
Bytes (UTF-8)
Wörter
Zeilen
Sätze
Absätze
Lesezeit
Auf dieser Seite

Was ist ein Textstatistik-Werkzeug?#

Ein Textstatistik-Werkzeug liest einen Textblock und sagt Ihnen, was tatsächlich darin steckt: wie viele Zeichen, wie viele Wörter, wie viele Sätze, wie groß er in Bytes ist, und wie lange ein Leser etwa braucht, um ihn zu Ende zu lesen. Das klingt trivial, bis Sie an eine Grenze stoßen, die zuschlägt — ein Tweet, das ein Zeichen zu lang ist; eine Meta-Description, die lautlos 160 Bytes überschreitet; ein Eingabefeld, dessen maxlength in UTF-8-Bytes statt in sichtbaren Zeichen gemessen wird; oder ein Entwurf, dessen „2 Minuten Lesezeit“-Badge lautlos falsch ist.

Der Haken ist, dass „ein Wort“ kein universelles Konzept ist. Englische Wörter werden durch Leerzeichen getrennt, Chinesisch, Japanisch und Thai aber nicht — 你好世界 sind vier Zeichen und vier Wörter, ohne ein einziges Leerzeichen. Ein naives .split(' ') meldet für die ganze Zeichenkette ein „Wort“. Dieses Werkzeug zählt pro Zeichen für CJK-Ideographen, Hiragana, Katakana und Thai, und nach Whitespace-getrennten Läufen für Latein, Kyrillisch, Griechisch, Devanagari und Hangul, sodass die Wortzahl über Schriften hinweg ehrlich ist. Die Bytegröße nutzt echte UTF-8-Kodierung (nicht string.length), was zählt, wenn ein Server oder eine Datenbankspalte Bytes zählt.

Alles läuft in Ihrem Browser — es gibt kein Backend, und nichts wird hochgeladen.

So wird es verwendet#

  1. Tippen oder fügen Sie Ihren Text in das Feld Eingabe auf der linken Seite ein. Das Feld akzeptiert jede Schrift und bewahrt Zeilenumbrüche.
  2. Klicken Sie auf Beispiel, um einen fertigen Absatz zu laden, wenn Sie nur die Zahlen bewegen sehen möchten, oder auf Leeren, um das Feld zu leeren.
  3. Lesen Sie das rechte Panel. Acht Zeilen aktualisieren sich live beim Tippen:
    • Zeichen — gesamte Codeeinheiten-Anzahl, inklusive Leerzeichen und Zeilenumbrüchen.
    • Zeichen (ohne Leerzeichen) — dasselbe, minus jedes Whitespace-Zeichens.
    • Bytes — UTF-8-Bytelänge, die Zahl, die ein Datenbank-VARCHAR(n) oder eine HTTP-Header-Grenze tatsächlich sieht.
    • Wörter — schriftbewusste Zählung (CJK/Kana/Thai pro Zeichen, alles andere nach leerzeichengetrennten Läufen).
    • Zeilen — durch Zeilenumbruch getrennte Reihen.
    • Sätze — Aufteilung nach Satzzeichen über Schriften hinweg (. ! ? plus CJK 。!? und Arabisch ؟۔).
    • Absätze — Blöcke, getrennt durch eine Leerzeile.
    • Lesezeit — Wörter geteilt durch ~200 Wörter pro Minute, aufgerundet auf mindestens eine Minute.

Die wichtigsten Funktionen#

  • Schriftbewusste Wortzählung. CJK-Ideographen, Hiragana, Katakana und Thai zählen jeweils als ein Wort pro Zeichen; Latein, Kyrillisch, Griechisch, Devanagari und Hangul zählen nach leerzeichengetrennten Läufen. Ein gemischter Satz erhält eine sinnvolle Summe, keine kaputte.
  • Echte UTF-8-Bytegröße. 你好 sind 6 Bytes, nicht 2 — der Bytezähler spiegelt, was Speicherung und Transport tatsächlich kosten.
  • Schriftübergreifende Satz-Aufteilung. Erkennt CJK- und arabische Satzzeichen, sodass 今天天气很好。明天见。 als zwei Sätze zählt, nicht als einer.
  • Live, kein Klick nötig. Zahlen berechnen sich bei jedem Tastendruck neu; es gibt keinen „Erzeugen“-Schritt, den man vergessen kann.
  • Bleibt auf Ihrer Maschine. Eingefügter Text verlässt nie die Seite — keine Anfrage, kein Log, kein Backend.

Anwendungsbeispiel#

Fügen Sie den klassischen Pangramm ein:

The quick brown fox jumps over the lazy dog.

Das Panel meldet:

  • Zeichen: 44 (Punkt und 8 Leerzeichen inklusive)
  • Zeichen (ohne Leerzeichen): 36
  • Bytes: 44 (jedes Zeichen ist ASCII, daher entsprechen Bytes hier Zeichen)
  • Wörter: 9
  • Zeilen: 1
  • Sätze: 1
  • Absätze: 1
  • Lesezeit: 1 Minute (9 Wörter liegen weit unter 200, aber der Zähler rundet auf eine Minute auf, sodass ein leeres „0 Min.“ nie erscheint)

Tauschen Sie den chinesischen Satz 你好世界。 ein und die Wortzahl wird 4 (eins pro Han-Zeichen), während die Bytes auf 13 springen — vier 3-Byte-Zeichen plus der 1-Byte-Punkt. Genau diese Lücke zwischen „4 Zeichen“ und „13 Bytes“ ist die Art Überraschung, die dieses Werkzeug zutage fördert, bevor es ein Formular-Submit tut.

FAQ#

Warum ist meine Bytezahl so viel größer als meine Zeichenzahl?#

Weil UTF-8 nicht-ASCII-Zeichen mit mehreren Bytes kodiert: ein Byte für den Basis-Latein-Bereich, zwei für Latin Extended (à, ñ, ç), drei für die meisten CJK-Ideographen und indischen Schriften, und vier für Emoji und die Astral-Ebene. Formulare und Datenbanken, die ein Byte-Budget durchsetzen, sehen die größere Zahl, daher meldet dieses Werkzeug Bytes auf dieselbe Weise.

Die Wortzahl für meinen chinesischen Text fühlt sich hoch an. Stimmt das?#

Wahrscheinlich ja. CJK-Schriften trennen Wörter nicht mit Leerzeichen, daher ist eine Pro-Zeichen-Zählung die konventionelle, reproduzierbare Methode, sie zu messen — und sie entspricht, wie die meisten Editoren und Textverarbeitungen CJK-Länge melden. Wenn Sie linguistische Wortsegmentierung statt Zeichenzählung benötigen, nutzt der CJK-Modus des Werkzeugs /en/text/word-frequency/ den Segmenter des Browsers, um an tatsächlichen Wortgrenzen zu trennen.

Welche Lesegeschwindigkeit nimmt „Lesezeit“ an?#

Etwa 200 Wörter pro Minute, ein vielgenutzter Durchschnitt für leises Lesen von Erwachsenen bei Klartext. Es ist eine grobe Schätzung — technische Inhalte, Code oder eine Fremdsprache werden langsamer sein. Der Wert wird immer auf mindestens eine Minute aufgerundet, damit ein kurzer Schnipsel keine bedeutungslose „0 Minuten“ zeigt.

Zählt es Wörter in einem Code-Schnipsel genauso wie in Prosa?#

Ja — Bezeichner wie getUserById werden als ein Token behandelt, weil kein Leerzeichen und keine Zeichensetzung darin sind. Wenn Sie getUserById als drei Wörter zählen möchten, schicken Sie es erst durch den Trenner des Werkzeugs /en/text/transform/.