ToolZen ToolZen
Text utility client

Word Counter

Count words, characters, sentences, and paragraphs instantly. Includes estimated reading time and average word length.

Advertisement (Top Banner)

Statistics

0

Characters

0

Without spaces

0

Words

0

Lines

0

Sentences

0'

Reading (min)

Advertisement (Bottom)

Compter des mots semble la chose la plus simple qu'un ordinateur puisse faire, et ce n'est pas le cas. Où finit un mot est une question de langue, pas d'espaces — et tout compteur en désaccord avec un autre discute exactement de cela. Voici ce que celui-ci compte, et où il admet honnêtement renoncer.

Découper aux espaces est faux pour l'essentiel du monde

L'implémentation évidente — couper le texte là où il y a une espace — fonctionne pour le français, l'anglais, l'allemand et toute autre langue qui met des blancs entre les mots. Elle échoue complètement pour celles qui n'en mettent pas. Le chinois, le japonais et le thaï s'écrivent sans espaces : l'approche naïve annonce donc un paragraphe entier comme un seul mot.

Cet outil utilise Intl.Segmenter, la segmentation de texte intégrée au navigateur, qui connaît les règles de chaque langue au lieu de chercher des blancs. 我喜欢吃苹果和香蕉 compte 6 mots au lieu de 1, et 私は日本語を話します en compte 7. Pour le français, le résultat est identique au naïf : rien ne change pour la plupart des visiteurs — cela cesse simplement d'être faux pour tous les autres.

La segmentation est réellement difficile, et même un bon segmenteur porte des jugements. Si « New York » est un mot ou deux, si un composé à trait d'union compte une fois ou deux, si une apostrophe scinde un jeton — cela n'a pas de réponse universelle, et c'est la vraie raison pour laquelle deux compteurs divergent.

Un caractère n'est pas ce que JavaScript croit

Les chaînes JavaScript sont des suites d'unités de code UTF-16, et une unité de code n'est pas un caractère. Demandez à JavaScript la longueur d'un emoji pouce levé : il répond 2. Demandez-la pour un emoji famille — de ceux formés de plusieurs personnes réunies — il répond 8. Aucun de ces nombres n'est ce qu'un humain appellerait un nombre de caractères.

Cet outil compte plutôt des groupes de graphèmes : les unités qu'un lecteur désignerait en disant « un caractère ». L'emoji famille en fait un. Une lettre accentuée en fait un, qu'elle ait été tapée comme point de code unique ou composée d'une lettre et d'un signe combinant. Si vous comparez ce nombre à une limite imposée par un autre système, sachez que cet autre système compte très probablement encore des unités de code, et vous contredira dès qu'un emoji apparaîtra.

Le comptage de phrases est une heuristique et se trompe parfois

C'est la partie sur laquelle il faut être franc. L'outil compte les phrases en cherchant les points, points d'interrogation et points d'exclamation. C'est une heuristique, et les heuristiques échouent de façon prévisible.

« Le Dr. Martin est arrivé. » compte deux phrases, car l'abréviation porte un point. « Pi vaut environ 3.14 exactement. » en compte deux, pour la même raison. Les points de suspension se comportent correctement — « Attends... vraiment ? » donne deux, car les suites de ponctuation fusionnent en une seule correspondance — mais c'est de la chance, pas de la conception.

Faire mieux suppose de détecter abréviations, décimales, initiales, URL et citations : un problème propre à chaque langue, sans petite solution. Le nombre affiché ici est une approximation utile pour la prose, et il ne faut pas s'y fier sur quoi que ce soit de technique. Connaître la limite est plus utile qu'un nombre qui prétend ne pas en avoir.

Le temps de lecture est une moyenne, et vous n'êtes pas la moyenne

Le chiffre vient de la division du nombre de mots par 200, convention largement répandue pour la vitesse de lecture d'un adulte. Les vitesses réelles de lecture silencieuse vont d'environ 200 à 300 mots par minute pour des adultes lisant de la prose, et l'écart entre individus est bien plus large.

Le nombre suppose aussi que le texte est de la prose. La documentation technique, le code, la documentation de référence dense et tout ce qu'on relit sont bien plus lents. Prenez-le comme un signal grossier — « ceci est une lecture de cinq minutes, pas de trente secondes » — et non comme une mesure. C'est devenu un standard sur les blogs parce que cela fixe des attentes, pas parce que c'est exact.

Questions fréquentes

Mon texte est-il envoyé à un serveur ?

Non. Cet outil porte la mention « client » : tout est compté dans votre onglet au fil de la frappe. Rien n'est transmis ni conservé — ce qui compte ici, car on colle dans les compteurs de mots des brouillons, des essais et des manuscrits qu'on préférerait ne pas confier à un inconnu.

Pourquoi mon nombre de mots diffère-t-il de Microsoft Word ?

Parce que vous avez posé à deux programmes la même question ambiguë. Word a ses propres règles sur les traits d'union, les nombres, les URL et sur ce qui compte comme un mot, et ces règles ne sont pas celles du navigateur. Aucun n'a tort. Si vous avez une limite stricte à respecter, comptez avec l'outil qu'utilisera la personne qui impose la limite — c'est le seul décompte qui compte.

Le nombre de caractères inclut-il les espaces ?

Les deux sont affichés. La distinction pèse plus qu'il n'y paraît : éditeurs et typographes entendent généralement « avec les espaces », tandis que les limites de caractères dans les formulaires et les bases de données comptent généralement tous les caractères, espaces compris. Quand on vous donne une limite sans préciser, on veut presque toujours dire avec les espaces.

Pourquoi un emoji compte-t-il pour un caractère ici et deux ailleurs ?

Parce que la plupart des systèmes comptent des unités de code UTF-16 et que la plupart des emoji en occupent deux. Cet outil compte ce que vous verriez. Le désaccord est réel et compte pour tout ce qui a une limite stricte — une colonne de base définie à 100 caractères peut rejeter un texte que cet outil annonce à 95, parce qu'elle compte autrement. Si une limite est appliquée quelque part, découvrez ce que compte ce quelque part.

Puis-je me fier au comptage de phrases pour un travail universitaire ?

Pas sans le vérifier. Tout texte comportant abréviations, initiales, décimales ou citations sera surcompté, et l'écriture universitaire est pleine des quatre. Pour une idée grossière de la longueur des phrases dans un brouillon, cela suffit. Pour un chiffre que vous allez rapporter, comptez vous-même.