Estatísticas de texto
TextoConta caracteres, bytes, palavras, linhas, frases e parágrafos com divisão de palavras amigável a vários idiomas.
- Caracteres
- Caracteres (sem espaços)
- Bytes (UTF-8)
- Palavras
- Linhas
- Frases
- Parágrafos
- Tempo de leitura
Nesta página
O que é uma ferramenta de estatísticas de texto?#
Uma ferramenta de estatísticas de texto lê um bloco de texto e diz-lhe o que efetivamente lá está: quantos carateres, quantas palavras, quantas frases, quantos bytes ocupa e, aproximadamente, quanto tempo um leitor demorará a terminar. Isso parece trivial até bater num limite que morde — um tuíte com um caráter a mais, uma meta description que excede silenciosamente 160 bytes, um campo de entrada cujo maxlength é medido em bytes UTF-8 em vez de carateres visíveis, ou um rascunho cuja etiqueta “2 minutos de leitura” está silenciosamente errada.
O problema é que “uma palavra” não é um conceito universal. As palavras inglesas separam-se por espaços, mas chinês, japonês e tailandês não — 你好世界 são quatro carateres e quatro palavras, sem espaço à vista. Um .split(' ') ingénuo reporta uma “palavra” para essa string toda. Esta ferramenta conta por caráter para ideogramas CJK, hiragana, katakana e tailandês, e por sequências separadas por espaços para latino, cirílico, grego, devanágari e hangul, pelo que a contagem de palavras é honesta entre escritas. O tamanho em bytes usa codificação UTF-8 real (não string.length), o que importa quando um servidor ou coluna de base de dados conta bytes.
Tudo corre no seu navegador — não há backend e nada é enviado.
Como usar#
- Escreva ou cole o seu texto na caixa de entrada à esquerda. A caixa aceita qualquer escrita e preserva as quebras de linha.
- Clique em Exemplo para carregar uma passagem pronta se só quer ver os números mexerem-se, ou em Limpar para esvaziar a caixa.
- Leia o painel direito. Oito linhas atualizam-se em tempo real à medida que escreve:
- Caracteres — contagem total de unidades de código, incluindo espaços e quebras de linha.
- Caracteres (sem espaços) — o mesmo, menos todos os carateres de espaço.
- Bytes — comprimento em bytes UTF-8, o número que uma
VARCHAR(n)de base de dados ou um limite de cabeçalho HTTP realmente vê. - Palavras — contagem sensível à escrita (CJK/kana/tailandês por caráter, tudo o resto por sequências separadas por espaços).
- Linhas — linhas separadas por quebra de linha.
- Frases — divididas por terminadores entre escritas (
.!?mais os CJK。!?e o árabe؟۔). - Parágrafos — blocos separados por uma linha em branco.
- Tempo de leitura — palavras divididas por ~200 palavras por minuto, arredondado para cima a pelo menos um minuto.
Principais recursos#
- Contagem de palavras sensível à escrita. Ideogramas CJK, hiragana, katakana e tailandês contam cada um como uma palavra por caráter; latino, cirílico, grego, devanágari e hangul contam por sequências separadas por espaços. Uma frase mista obtém um total sensato, não partido.
- Tamanho real em bytes UTF-8.
你好são 6 bytes, não 2 — o contador de bytes reflete o que o armazenamento e o transporte efetivamente custam. - Divisão de frases entre escritas. Reconhece terminadores CJK e árabes, pelo que
今天天气很好。明天见。conta como duas frases, não uma. - Em tempo real, sem clique. Os números recalculam-se em cada toque de tecla; não há passo de Gerar para esquecer.
- Fica na sua máquina. O texto colado nunca sai da página — sem pedido, sem registro, sem backend.
Exemplo detalhado#
Cole o pangrama clássico:
The quick brown fox jumps over the lazy dog.
O painel reporta:
- Carateres: 44 (o ponto e os 8 espaços estão incluídos)
- Carateres (sem espaços): 36
- Bytes: 44 (todos os carateres são ASCII, pelo que bytes igualam carateres aqui)
- Palavras: 9
- Linhas: 1
- Frases: 1
- Parágrafos: 1
- Tempo de leitura: 1 minuto (9 palavras está muito abaixo de 200, mas o contador arredonda para baixo para um minuto para que um “0 min” vazio nunca apareça)
Troque pela frase chinesa 你好世界。 e a contagem de palavras passa a 4 (uma por caráter Han), enquanto os bytes saltam para 13 — quatro carateres de 3 bytes mais o ponto de 1 byte. Essa diferença entre “4 carateres” e “13 bytes” é exatamente o tipo de surpresa que esta ferramenta existe para revelar antes que um formulário o faça ao submeter.
Perguntas frequentes#
Porque é que a minha contagem de bytes é muito maior do que a contagem de carateres?#
Porque o UTF-8 codifica carateres não-ASCII com vários bytes: um byte para a gama latina básica, dois para o latino estendido (à, ñ, ç), três para a maioria dos ideogramas CJK e escritas índicas, e quatro para emojis e o plano astral. Formulários e bases de dados que impõem um orçamento de bytes veem o número maior, pelo que esta ferramenta reporta bytes da mesma forma.
A contagem de palavras para o meu texto chinês parece alta. Está certa?#
Provavelmente. As escritas CJK não separam palavras com espaços, pelo que uma contagem por caráter é a forma convencional e reprodutível de as medir — e corresponde à forma como a maioria dos editores e processadores de texto reportam o comprimento CJK. Se precisa de segmentação linguística de palavras em vez de contagem de carateres, o modo CJK da ferramenta /en/text/word-frequency/ usa o segmentador do navegador para dividir pelas verdadeiras fronteiras de palavras.
Que velocidade de leitura é que o “tempo de leitura” assume?#
Cerca de 200 palavras por minuto, uma média amplamente usada para leitura silenciosa adulta de prosa simples. É uma estimativa grosseira — conteúdo técnico, código ou numa língua estrangeira será mais lento. O valor é sempre arredondado para cima a pelo menos um minuto para que um excerto curto não mostre um “0 minutos” sem significado.
Conta palavras num excerto de código da mesma forma que em prosa?#
Sim — identificadores como getUserById são tratados como um token porque não há espaço nem pontuação dentro deles. Se quer que getUserById conte como três palavras, passe-o primeiro pelo divisor de maiúsculas da ferramenta /en/text/transform/.