Langue : Français

tools / wordcount

wordcount/

Compte en direct les caractères chinois, les mots, les caractères, la ponctuation, les paragraphes, les lignes et les octets UTF-8, et estime le temps de lecture.

Temps de lecture : 400 caractères chinois / japonais / coréens par minute + 200 mots par minute

Texte

Statistiques

Paragraphes = lignes non vides. La ponctuation compte les caractères de ponctuation Unicode (CJK et ASCII).

Questions fréquentes

Comment sont comptés les « Caractères chinois » ? La ponctuation, les chiffres, le japonais et le coréen comptent-ils ?

Seuls les sinogrammes (caractères han) sont comptés ; la ponctuation, les chiffres et les lettres latines ne le sont pas. Les kanji d'un texte japonais sont inclus, alors que les kana et le hangul coréen ne sont pas comptés comme caractères chinois, mais ils entrent dans le total des caractères et dans le temps de lecture. Les caractères rares des blocs CJK étendus sont également reconnus. Pour un total qui inclut la ponctuation, regardez « Caractères (sans espaces) ».

Comment sont comptés les mots, et pourquoi le résultat diffère-t-il de Word ?

Toute suite de lettres compte pour un mot, pas seulement en anglais : les lettres accentuées (é, è, ç, ï…), la ñ, le ß, l'alphabet cyrillique et les lettres vietnamiennes à tons sont reconnus (en vietnamien, chaque syllabe compte pour un mot). Une apostrophe ne coupe pas un mot (l'été et aujourd'hui comptent chacun pour un), un mot à trait d'union comme well-known ou peut-être compte pour deux, et les nombres comme 2024 ne sont pas des mots. Les caractères chinois, les kana japonais et le hangul coréen ne sont pas comptés comme mots : les caractères chinois ont leur propre ligne, et les kana et le hangul entrent dans le total des caractères et dans le temps de lecture. Les logiciels qui découpent sur les espaces, Word par exemple, comptent well-known et 2024 chacun pour un mot : des totaux différents sont donc normaux.

Quelle différence entre les caractères avec et sans espaces, et combien compte un emoji ?

« Caractères (avec espaces) » compte tout, y compris les espaces, les tabulations et chaque saut de ligne ; « Caractères (sans espaces) » retire d'abord tous les espaces blancs (les espaces pleine largeur aussi), puis compte. Le décompte se fait par point de code Unicode : un caractère chinois ou un emoji simple compte pour 1, mais les emoji composés comme les variantes de teinte de peau, les drapeaux et les familles sont formés de plusieurs points de code et comptent pour 2 ou plus. La ligne « Ponctuation » utilise la catégorie de ponctuation d'Unicode : des symboles comme $, + et = ne sont donc pas de la ponctuation, mais comptent comme des caractères.

Que sont les « Octets (UTF-8) », et pourquoi diffèrent-ils de la taille du fichier ?

C'est le nombre d'octets que le texte occupe une fois encodé en UTF-8 : 1 octet pour les lettres sans accent, les chiffres et la ponctuation ASCII (2 pour les lettres accentuées), 3 pour les caractères chinois, japonais et coréens courants, et 4 pour la plupart des emoji. Chaque saut de ligne compte ici pour 1 octet, alors que les fichiers de style Windows (\r\n) en utilisent 2 par saut de ligne, et un BOM en début de fichier en ajoute 3 de plus : le chiffre peut donc différer légèrement de la taille réelle du fichier. Les fichiers enregistrés dans d'autres encodages comme GBK auront un nombre d'octets différent.

Quelle différence entre « Paragraphes » et « Lignes », et pourquoi y a-t-il plus de paragraphes que prévu ?

Le nombre de paragraphes est le nombre de lignes non vides ; « Lignes » compte toutes les lignes, y compris les lignes vides. Tout saut de ligne suivi de texte démarre un nouveau paragraphe, sans exiger de ligne vide entre les deux, tandis qu'un texte qui passe simplement à la ligne dans la fenêtre n'est pas compté comme une ligne en plus. Une touche Entrée en plus à la fin ajoute 1 à « Lignes » et ne change pas « Paragraphes ».

Comment le temps de lecture estimé est-il calculé, et est-il précis ?

Les caractères chinois, les kana et le hangul sont comptés ensemble à 400 par minute et les mots à 200 par minute, puis les deux parties sont additionnées ; les chiffres et la ponctuation ne sont pas comptés. Ce n'est qu'une estimation pour un lecteur moyen : la vitesse de lecture réelle et la difficulté du texte varient beaucoup. En dessous d'une minute, le temps est affiché en secondes.

Que modifie exactement « Supprimer les lignes vides en trop / rogner les espaces » ?

Il réécrit directement le texte de la zone et fait trois choses : il retire les espaces blancs au début et à la fin de chaque ligne (espaces pleine largeur compris), réduit à une seule les séries de plusieurs lignes vides, et supprime les lignes vides tout au début et tout à la fin du texte. Les espaces à l'intérieur d'une ligne et les lignes vides isolées ne sont pas touchés. Si vous avez besoin de l'original, gardez-en d'abord une copie.

Le texte que je colle est-il envoyé ou enregistré ?

Non. Le comptage se fait dans votre navigateur ; l'outil n'envoie aucun texte à un serveur et ne le conserve pas sur votre appareil : il faut donc coller à nouveau après avoir rouvert la page. Avec un texte très long (plus de 200 000 caractères), les chiffres apparaissent un peu plus tard.