Herramientas
Guías

Estadísticas de texto

Texto

Cuenta caracteres, bytes, palabras, líneas, oraciones y párrafos con división de palabras apta para varios idiomas.

100 % del lado del cliente Sin backend
Caracteres
Caracteres (sin espacios)
Bytes (UTF-8)
Palabras
Líneas
Oraciones
Párrafos
Tiempo de lectura
En esta página

¿Qué es una herramienta de estadísticas de texto?#

Una herramienta de estadísticas de texto lee un bloque de texto y te dice qué hay realmente dentro: cuántos caracteres, cuántas palabras, cuántas oraciones, cuánto ocupa en bytes y, aproximadamente, cuánto tardará un lector en terminarlo. Parece trivial hasta que topas con un límite que te muerde: un tweet que se pasa en un carácter, una meta description que supera en silencio los 160 bytes, un campo de entrada cuyo maxlength se mide en bytes UTF-8 en vez de en caracteres visibles, o un borrador cuya etiqueta de «2 minutos de lectura» está equivocada en silencio.

El problema es que «una palabra» no es un concepto universal. Las palabras en inglés se separan con espacios, pero el chino, el japonés y el tailandés no: 你好世界 son cuatro caracteres y cuatro palabras, sin ningún espacio a la vista. Un .split(' ') ingenuo informa de una sola «palabra» para toda la cadena. Esta herramienta cuenta carácter a carácter para los ideogramas CJK, el hiragana, el katakana y el tailandés, y por secuencias separadas por espacios en blanco para el latino, el cirílico, el griego, el devanágari y el hangul, de modo que el recuento de palabras es honrado en todos los sistemas de escritura. El tamaño en bytes usa la codificación UTF-8 real (no string.length), que es lo que importa cuando un servidor o una columna de base de datos cuenta bytes.

Todo se ejecuta en tu navegador: no hay backend y nada se sube.

Cómo se usa#

  1. Escribe o pega tu texto en la caja de Entrada de la izquierda. La caja admite cualquier sistema de escritura y conserva los saltos de línea.
  2. Pulsa Ejemplo para cargar un pasaje listo si solo quieres ver cómo se mueven los números, o Limpiar para vaciar la caja.
  3. Lee el panel derecho. Ocho filas se actualizan en vivo mientras escribes:
    • Caracteres: recuento total de unidades de código, incluidos espacios y saltos de línea.
    • Caracteres (sin espacios): lo mismo, menos todos los caracteres de espacio en blanco.
    • Bytes: longitud en bytes UTF-8, el número que un VARCHAR(n) de base de datos o un límite de cabecera HTTP ve en realidad.
    • Palabras: recuento consciente del sistema de escritura (CJK/kana/tailandés por carácter; todo lo demás, por secuencias separadas por espacios).
    • Líneas: filas separadas por saltos de línea.
    • Oraciones: división por terminadores en distintos sistemas de escritura (. ! ?, además de los CJK 。!? y los árabes ؟۔).
    • Párrafos: bloques separados por una línea en blanco.
    • Tiempo de lectura: palabras divididas entre unas 200 palabras por minuto, redondeado hacia arriba a un mínimo de un minuto.

Características clave#

  • Recuento de palabras consciente del sistema de escritura. Los ideogramas CJK, el hiragana, el katakana y el tailandés cuentan cada uno como una palabra por carácter; el latino, el cirílico, el griego, el devanágari y el hangul cuentan por secuencias separadas por espacios. Una oración mixta obtiene un total sensato, no uno roto.
  • Tamaño real en bytes UTF-8. 你好 son 6 bytes, no 2: el contador de bytes refleja lo que realmente cuesta almacenamiento y transporte.
  • División de oraciones entre sistemas de escritura. Reconoce los terminadores CJK y árabes, así que 今天天气很好。明天见。 cuenta como dos oraciones, no como una.
  • En vivo, sin pulsar nada. Los números se recalculan en cada pulsación de tecla; no hay ningún paso de Generar que se te pueda olvidar.
  • Se queda en tu máquina. El texto pegado nunca sale de la página: sin petición, sin log, sin backend.

Ejemplo práctico#

Pega el clásico pangrama:

The quick brown fox jumps over the lazy dog.

El panel informa:

  • Caracteres: 44 (el punto y los 8 espacios están incluidos)
  • Caracteres (sin espacios): 36
  • Bytes: 44 (cada carácter es ASCII, así que aquí los bytes igualan a los caracteres)
  • Palabras: 9
  • Líneas: 1
  • Oraciones: 1
  • Párrafos: 1
  • Tiempo de lectura: 1 minuto (9 palabras está muy por debajo de 200, pero el contador tiene un mínimo de un minuto para que nunca aparezca un «0 min» vacío)

Cámbialo por la oración en chino 你好世界。 y el recuento de palabras pasa a 4 (uno por carácter Han), mientras que los bytes saltan a 13: cuatro caracteres de 3 bytes más el punto de 1 byte. Esa brecha entre «4 caracteres» y «13 bytes» es justo el tipo de sorpresa que esta herramienta existe para revelar antes de que lo haga el envío de un formulario.

Preguntas frecuentes#

¿Por qué mi recuento de bytes es mucho mayor que el de caracteres?#

Porque UTF-8 codifica los caracteres no ASCII con varios bytes: uno para el rango latino básico, dos para el latino extendido (à, ñ, ç), tres para la mayoría de los ideogramas CJK y las escrituras índicas, y cuatro para los emoji y el plano astral. Los formularios y las bases de datos que aplican un presupuesto en bytes ven el número mayor, así que esta herramienta informa de los bytes de la misma manera.

El recuento de palabras de mi texto en chino me parece alto. ¿Es correcto?#

Probablemente. Las escrituras CJK no separan las palabras con espacios, así que un recuento por carácter es la forma convencional y reproducible de medirlas, y coincide con cómo la mayoría de los editores y procesadores de texto informan de la longitud CJK. Si necesitas segmentación lingüística de palabras en vez de un recuento de caracteres, el modo CJK de la herramienta /en/text/word-frequency/ usa el segmentador del navegador para dividir por las fronteras de palabras reales.

¿Qué velocidad de lectura asume el «tiempo de lectura»?#

Unas 200 palabras por minuto, un promedio ampliamente utilizado para la lectura silenciosa adulta de prosa llana. Es una estimación burda: el contenido técnico, el código o un idioma extranjero irán más despacio. El valor siempre se redondea hacia arriba a un mínimo de un minuto para que un fragmento corto no muestre un «0 minutos» sin sentido.

¿Cuenta las palabras de un fragmento de código igual que la prosa?#

Sí: identificadores como getUserById se tratan como un solo token, porque no hay ningún espacio ni puntuación en su interior. Si quieres que getUserById cuente como tres palabras, pásalo antes por el divisor de mayúsculas de la herramienta /en/text/transform/.