Contar palabras suena a lo más sencillo que podría hacer un ordenador, y no lo es. Dónde acaba una palabra es una pregunta sobre el idioma, no sobre los espacios, y todo contador que discrepa de otro está discutiendo justo eso. Esto es lo que cuenta este, y dónde es honesto al decir que se rinde.
Partir por espacios está mal para buena parte del mundo
La implementación obvia —cortar el texto donde haya un espacio— funciona para el español, el inglés, el alemán y cualquier otro idioma que ponga huecos entre las palabras. Falla por completo con los que no. El chino, el japonés y el tailandés se escriben sin espacios, así que el enfoque ingenuo informa de un párrafo entero como una sola palabra.
Esta herramienta usa Intl.Segmenter, la segmentación de texto integrada en el navegador, que conoce las reglas de cada idioma en lugar de buscar huecos. 我喜欢吃苹果和香蕉 cuenta como 6 palabras en vez de 1, y 私は日本語を話します como 7. Para el español la respuesta es idéntica a la ingenua, así que para la mayoría de visitantes no cambia nada: simplemente deja de estar mal para todos los demás.
La segmentación es genuinamente difícil, y hasta un buen segmentador está emitiendo juicios. Si "New York" es una palabra o dos, si un compuesto con guion cuenta una vez o dos, si un apóstrofo parte un token: no tienen respuesta universal, y esa es la razón real de que dos contadores discrepen.
Un carácter no es lo que JavaScript cree
Las cadenas de JavaScript son secuencias de unidades de código UTF-16, y una unidad de código no es un carácter. Pídele a JavaScript la longitud de un emoji de pulgar arriba y dice 2. Pídesela para un emoji de familia —de esos formados por varias personas unidas— y dice 8. Ninguno de los dos números es lo que un humano llamaría un recuento de caracteres.
Esta herramienta cuenta en cambio grupos de grafemas: las unidades que un lector señalaría llamándolas "un carácter". El emoji de familia es uno. Una letra acentuada es una, tanto si se tecleó como punto de código único como si se compuso de letra más marca diacrítica. Si comparas este recuento con un límite impuesto por otro sistema, ten en cuenta que ese otro sistema muy probablemente sigue contando unidades de código, y discrepará contigo en cuanto aparezca un emoji.
El recuento de frases es una heurística y a veces se equivoca
Esta es la parte sobre la que conviene ser franco. La herramienta cuenta frases buscando puntos, interrogaciones y exclamaciones. Es una heurística, y las heurísticas fallan de formas predecibles.
"El Dr. Pérez llegó." cuenta como dos frases, porque la abreviatura lleva un punto. "Pi vale unos 3.14 exactos." cuenta dos, por lo mismo. Los puntos suspensivos sí se comportan bien —"Espera... ¿de verdad?" da dos, porque las rachas de puntuación colapsan en una sola coincidencia— pero es suerte, no diseño.
Hacerlo mejor significa detectar abreviaturas, decimales, iniciales, URLs y citas, que es un problema específico de cada idioma sin solución pequeña. El número de aquí es una aproximación útil para la prosa, y no deberías fiarte de él con nada técnico. Conocer la limitación es más útil que un número que finge no tener ninguna.
El tiempo de lectura es una media y tú no eres la media
La cifra sale de dividir el recuento de palabras entre 200, una convención muy usada para la velocidad de lectura de un adulto. Las velocidades reales de lectura silenciosa van de unas 200 a 300 palabras por minuto en adultos leyendo prosa, y la dispersión entre individuos es mucho mayor.
El número también supone que el texto es prosa. La documentación técnica, el código, el material de referencia denso y cualquier cosa que releas son mucho más lentos. Trátalo como una señal aproximada —"esto es una lectura de cinco minutos, no de treinta segundos"— y no como una medida. Se ha vuelto un estándar en los blogs porque fija expectativas, no porque sea preciso.
Preguntas frecuentes
¿Se envía mi texto a un servidor?
No. Esta herramienta está marcada como "client": todo se cuenta en la pestaña de tu navegador mientras escribes. No se transmite ni se guarda nada, lo que importa aquí porque en los contadores de palabras se pegan borradores, ensayos y manuscritos que nadie querría entregar a un desconocido.
¿Por qué mi recuento difiere del de Microsoft Word?
Porque has hecho a dos programas la misma pregunta ambigua. Word tiene sus propias reglas sobre guiones, números, URLs y qué cuenta como palabra, y esas reglas no son las del navegador. Ninguno está mal. Si tienes un límite estricto que cumplir, cuenta con la herramienta que usará quien impone el límite: es el único recuento que importa.
¿El recuento de caracteres incluye espacios?
Se muestran ambos. La distinción importa más de lo que parece: editoriales y tipógrafos suelen referirse a "con espacios", mientras que los límites de caracteres en formularios y bases de datos suelen contar todos los caracteres, espacios incluidos. Cuando alguien te da un límite sin especificar, casi siempre quiere decir con espacios.
¿Por qué un emoji cuenta un carácter aquí y dos en otros sitios?
Porque la mayoría de los sistemas cuentan unidades de código UTF-16 y la mayoría de los emojis ocupan dos. Esta herramienta cuenta lo que verías. La discrepancia es real e importa con cualquier cosa que tenga un límite estricto: una columna de base de datos definida como 100 caracteres puede rechazar un texto que esta herramienta dice que tiene 95, porque cuenta distinto. Si se impone un límite en algún sitio, averigua qué cuenta ese sitio.
¿Puedo fiarme del recuento de frases para trabajo académico?
No sin comprobarlo. Cualquier texto con abreviaturas, iniciales, decimales o citas se contará de más, y la escritura académica está llena de las cuatro. Para hacerse una idea aproximada de la longitud de las frases en un borrador, vale. Para algo que vayas a reportar como dato, cuéntalas tú.