Ferramentas
Guias

Estatísticas de texto

Texto

Conta caracteres, bytes, palavras, linhas, frases e parágrafos com divisão de palavras amigável a vários idiomas.

100% no cliente Sem backend
Caracteres
Caracteres (sem espaços)
Bytes (UTF-8)
Palavras
Linhas
Frases
Parágrafos
Tempo de leitura
Nesta página

O que é uma ferramenta de estatísticas de texto?#

Uma ferramenta de estatísticas de texto lê um bloco de texto e diz-lhe o que efetivamente lá está: quantos carateres, quantas palavras, quantas frases, quantos bytes ocupa e, aproximadamente, quanto tempo um leitor demorará a terminar. Isso parece trivial até bater num limite que morde — um tuíte com um caráter a mais, uma meta description que excede silenciosamente 160 bytes, um campo de entrada cujo maxlength é medido em bytes UTF-8 em vez de carateres visíveis, ou um rascunho cuja etiqueta “2 minutos de leitura” está silenciosamente errada.

O problema é que “uma palavra” não é um conceito universal. As palavras inglesas separam-se por espaços, mas chinês, japonês e tailandês não — 你好世界 são quatro carateres e quatro palavras, sem espaço à vista. Um .split(' ') ingénuo reporta uma “palavra” para essa string toda. Esta ferramenta conta por caráter para ideogramas CJK, hiragana, katakana e tailandês, e por sequências separadas por espaços para latino, cirílico, grego, devanágari e hangul, pelo que a contagem de palavras é honesta entre escritas. O tamanho em bytes usa codificação UTF-8 real (não string.length), o que importa quando um servidor ou coluna de base de dados conta bytes.

Tudo corre no seu navegador — não há backend e nada é enviado.

Como usar#

  1. Escreva ou cole o seu texto na caixa de entrada à esquerda. A caixa aceita qualquer escrita e preserva as quebras de linha.
  2. Clique em Exemplo para carregar uma passagem pronta se só quer ver os números mexerem-se, ou em Limpar para esvaziar a caixa.
  3. Leia o painel direito. Oito linhas atualizam-se em tempo real à medida que escreve:
    • Caracteres — contagem total de unidades de código, incluindo espaços e quebras de linha.
    • Caracteres (sem espaços) — o mesmo, menos todos os carateres de espaço.
    • Bytes — comprimento em bytes UTF-8, o número que uma VARCHAR(n) de base de dados ou um limite de cabeçalho HTTP realmente vê.
    • Palavras — contagem sensível à escrita (CJK/kana/tailandês por caráter, tudo o resto por sequências separadas por espaços).
    • Linhas — linhas separadas por quebra de linha.
    • Frases — divididas por terminadores entre escritas (. ! ? mais os CJK 。!? e o árabe ؟۔).
    • Parágrafos — blocos separados por uma linha em branco.
    • Tempo de leitura — palavras divididas por ~200 palavras por minuto, arredondado para cima a pelo menos um minuto.

Principais recursos#

  • Contagem de palavras sensível à escrita. Ideogramas CJK, hiragana, katakana e tailandês contam cada um como uma palavra por caráter; latino, cirílico, grego, devanágari e hangul contam por sequências separadas por espaços. Uma frase mista obtém um total sensato, não partido.
  • Tamanho real em bytes UTF-8. 你好 são 6 bytes, não 2 — o contador de bytes reflete o que o armazenamento e o transporte efetivamente custam.
  • Divisão de frases entre escritas. Reconhece terminadores CJK e árabes, pelo que 今天天气很好。明天见。 conta como duas frases, não uma.
  • Em tempo real, sem clique. Os números recalculam-se em cada toque de tecla; não há passo de Gerar para esquecer.
  • Fica na sua máquina. O texto colado nunca sai da página — sem pedido, sem registro, sem backend.

Exemplo detalhado#

Cole o pangrama clássico:

The quick brown fox jumps over the lazy dog.

O painel reporta:

  • Carateres: 44 (o ponto e os 8 espaços estão incluídos)
  • Carateres (sem espaços): 36
  • Bytes: 44 (todos os carateres são ASCII, pelo que bytes igualam carateres aqui)
  • Palavras: 9
  • Linhas: 1
  • Frases: 1
  • Parágrafos: 1
  • Tempo de leitura: 1 minuto (9 palavras está muito abaixo de 200, mas o contador arredonda para baixo para um minuto para que um “0 min” vazio nunca apareça)

Troque pela frase chinesa 你好世界。 e a contagem de palavras passa a 4 (uma por caráter Han), enquanto os bytes saltam para 13 — quatro carateres de 3 bytes mais o ponto de 1 byte. Essa diferença entre “4 carateres” e “13 bytes” é exatamente o tipo de surpresa que esta ferramenta existe para revelar antes que um formulário o faça ao submeter.

Perguntas frequentes#

Porque é que a minha contagem de bytes é muito maior do que a contagem de carateres?#

Porque o UTF-8 codifica carateres não-ASCII com vários bytes: um byte para a gama latina básica, dois para o latino estendido (à, ñ, ç), três para a maioria dos ideogramas CJK e escritas índicas, e quatro para emojis e o plano astral. Formulários e bases de dados que impõem um orçamento de bytes veem o número maior, pelo que esta ferramenta reporta bytes da mesma forma.

A contagem de palavras para o meu texto chinês parece alta. Está certa?#

Provavelmente. As escritas CJK não separam palavras com espaços, pelo que uma contagem por caráter é a forma convencional e reprodutível de as medir — e corresponde à forma como a maioria dos editores e processadores de texto reportam o comprimento CJK. Se precisa de segmentação linguística de palavras em vez de contagem de carateres, o modo CJK da ferramenta /en/text/word-frequency/ usa o segmentador do navegador para dividir pelas verdadeiras fronteiras de palavras.

Que velocidade de leitura é que o “tempo de leitura” assume?#

Cerca de 200 palavras por minuto, uma média amplamente usada para leitura silenciosa adulta de prosa simples. É uma estimativa grosseira — conteúdo técnico, código ou numa língua estrangeira será mais lento. O valor é sempre arredondado para cima a pelo menos um minuto para que um excerto curto não mostre um “0 minutos” sem significado.

Conta palavras num excerto de código da mesma forma que em prosa?#

Sim — identificadores como getUserById são tratados como um token porque não há espaço nem pontuação dentro deles. Se quer que getUserById conte como três palavras, passe-o primeiro pelo divisor de maiúsculas da ferramenta /en/text/transform/.