Outils
Guides

Statistiques de texte

Texte

Compte les caractères, octets, mots, lignes, phrases et paragraphes avec une segmentation adaptée aux multilingues.

100 % côté client Sans backend
Caractères
Caractères (sans espaces)
Octets (UTF-8)
Mots
Lignes
Phrases
Paragraphes
Temps de lecture
Sur cette page

Qu’est-ce qu’un outil de statistiques de texte ?#

Un outil de statistiques de texte lit un bloc de texte et vous dit ce qu’il contient réellement : combien de caractères, combien de mots, combien de phrases, quelle taille en octets, et combien de temps un lecteur mettra grossièrement à le finir. Cela paraît trivial jusqu’à ce qu’une limite vous morde — un tweet à un caractère au-dessus, une meta description qui dépasse silencieusement les 160 octets, un champ de saisie dont le maxlength se compte en octets UTF-8 plutôt qu’en caractères visibles, ou un brouillon dont le badge « lecture 2 minutes » est silencieusement faux.

Le piège, c’est qu’« un mot » n’est pas un concept universel. Les mots anglais sont séparés par des espaces, mais le chinois, le japonais et le thaï ne le sont pas — 你好世界, c’est quatre caractères et quatre mots, sans un seul espace. Un naïf .split(' ') rapportera un « mot » pour toute la chaîne. Cet outil compte caractère par caractère pour les idéogrammes CJK, les hiragana, les katakana et le thaï, et par tronçons séparés par des blancs pour le latin, le cyrillique, le grec, le devanagari et le hangûl, afin que le compte de mots soit honnête quel que soit l’écrit. La taille en octets utilise un véritable encodage UTF-8 (et non string.length), ce qui compte quand un serveur ou une colonne de base de données compte en octets.

Tout s’exécute dans votre navigateur — pas de backend, rien n’est téléversé.

Comment l’utiliser#

  1. Saisissez ou collez votre texte dans le champ Entrée à gauche. Le champ accepte toute écriture et préserve les retours à la ligne.
  2. Cliquez sur Exemple pour charger un passage prêt à l’emploi si vous voulez simplement voir les chiffres bouger, ou Effacer pour vider le champ.
  3. Lisez le panneau de droite. Huit lignes se mettent à jour en direct au fil de la frappe :
    • Caractères — compte total des unités de code, espaces et retours à la ligne compris.
    • Caractères (sans espaces) — pareil, moins tout caractère de blanc.
    • Octets — longueur en octets UTF-8, le nombre que voit réellement une VARCHAR(n) de base de données ou une limite d’en-tête HTTP.
    • Mots — compte sensible à l’écrit (CJK/kana/thaï par caractère, tout le reste par tronçons séparés par des blancs).
    • Lignes — rangées séparées par les retours à la ligne.
    • Phrases — découpées sur les terminaisons entre écritures (. ! ? plus les 。!? CJK et ؟۔ arabes).
    • Paragraphes — blocs séparés par une ligne vide.
    • Temps de lecture — mots divisés par environ 200 mots par minute, arrondis à au moins une minute.

Fonctionnalités clés#

  • Comptage de mots sensible à l’écrit. Idéogrammes CJK, hiragana, katakana et thaï comptent chacun pour un mot par caractère ; latin, cyrillique, grec, devanagari et hangûl comptent par tronçons séparés par des espaces. Une phrase mixte donne un total sensé, pas un total cassé.
  • Taille en octets UTF-8 réelle. 你好, c’est 6 octets, pas 2 — le compteur d’octets reflète ce que coûte réellement le stockage et le transport.
  • Découpage de phrases entre écritures. Reconnaît les terminaisons CJK et arabes, donc 今天天气很好。明天见。 compte pour deux phrases, et non une.
  • En direct, sans clic. Les chiffres se recalculent à chaque frappe ; pas d’étape Générer à oublier.
  • Tout reste sur votre machine. Le texte collé ne quitte jamais la page — pas de requête, pas de journal, pas de backend.

Exemple commenté#

Collez le pangramme classique :

The quick brown fox jumps over the lazy dog.

Le panneau rapporte :

  • Caractères : 44 (le point et les 8 espaces sont inclus)
  • Caractères (sans espaces) : 36
  • Octets : 44 (chaque caractère est ASCII, donc octets égaux caractères ici)
  • Mots : 9
  • Lignes : 1
  • Phrases : 1
  • Paragraphes : 1
  • Temps de lecture : 1 minute (9 mots, c’est loin sous 200, mais le compteur plafonne à au moins une minute pour qu’un « 0 min » vide ne s’affiche jamais)

Remplacez par la phrase chinoise 你好世界。 et le compte de mots passe à 4 (un par caractère Han), tandis que les octets sautent à 13 — quatre caractères de 3 octets plus le point de 1 octet. Cet écart entre « 4 caractères » et « 13 octets » est exactement le genre de surprise que cet outil existe pour révéler avant qu’une soumission de formulaire ne le fasse.

FAQ#

Pourquoi mon compte d’octets est-il bien plus grand que mon compte de caractères ?#

Parce que l’UTF-8 encode les caractères non ASCII sur plusieurs octets : un octet pour la gamme latine de base, deux pour le latin étendu (à, ñ, ç), trois pour la plupart des idéogrammes CJK et des écritures indiennes, et quatre pour les emoji et le plan astral. Les formulaires et bases de données qui imposent un budget en octets voient le nombre le plus grand, donc cet outil rapporte les octets de la même façon.

Le compte de mots de mon texte chinois me semble élevé. Est-ce exact ?#

Probablement. Les écritures CJK ne séparent pas les mots par des espaces, donc un compte par caractère est la façon conventionnelle et reproductible de les mesurer — et il correspond à ce que la plupart des éditeurs et traitements de texte affichent pour la longueur CJK. Si vous avez besoin d’une segmentation linguistique plutôt que d’un compte de caractères, le mode CJK de l’outil /en/text/word-frequency/ utilise le segmenteur du navigateur pour découper sur les véritables frontières de mots.

Quelle vitesse de lecture le « temps de lecture » suppose-t-il ?#

Environ 200 mots par minute, moyenne largement utilisée pour la lecture silencieuse adulte de prose simple. C’est une estimation grossière — le contenu technique, le code ou une langue étrangère seront plus lents. La valeur est toujours arrondie à au moins une minute, pour qu’un court extrait n’affiche pas un « 0 minute » dénué de sens.

Compte-t-il les mots d’un extrait de code comme dans la prose ?#

Oui — les identifiants comme getUserById sont traités comme un seul token parce qu’il n’y a ni espace ni ponctuation dedans. Si vous voulez que getUserById compte pour trois mots, passez-le d’abord par le découpeur de casse de l’outil /en/text/transform/.