Sprache: Deutsch

tools / wordcount

wordcount/

Zählt chinesische Schriftzeichen, Wörter, Zeichen, Satzzeichen, Absätze, Zeilen und UTF-8-Bytes bei der Eingabe und schätzt die Lesezeit.

Lesezeit: 400 chinesische/japanische/koreanische Zeichen pro Min. + 200 Wörter pro Min.

Text

Statistik

Absätze = nicht leere Zeilen; Satzzeichen werden nach der Unicode-Kategorie für Satzzeichen gezählt (chinesische und lateinische).

Häufige Fragen

Wie werden „Chinesische Schriftzeichen“ gezählt, und zählen Satzzeichen, Ziffern, Japanisch und Koreanisch mit?

Gezählt werden nur Han-Zeichen; Satzzeichen, Ziffern und lateinische Buchstaben nicht. Kanji in japanischem Text werden mitgezählt, Kana und koreanische Hangul nicht als „Chinesische Schriftzeichen“, sie fließen aber in die Zeichenzahlen und die Lesezeit ein. Auch seltene Zeichen aus den erweiterten CJK-Blöcken werden erkannt. Für eine Gesamtzahl mit Satzzeichen schau auf „Zeichen (ohne Leerzeichen)“.

Wie werden Wörter gezählt, und warum weicht das Ergebnis von Word ab?

Gezählt wird jede zusammenhängende Buchstabenfolge, nicht nur englische: Umlaute wie ä, ö, ü, das ß, Buchstaben wie é oder ñ, kyrillische Buchstaben und vietnamesische Buchstaben mit Tonzeichen werden erkannt (Vietnamesisch zählt pro Silbe ein Wort). Ein Apostroph trennt kein Wort (don't und l'été zählen je als eines), ein Wort mit Bindestrich wie well-known oder E-Mail zählt als zwei, und reine Zahlen wie 2024 sind keine Wörter. Chinesische Schriftzeichen, japanische Kana und koreanisches Hangul zählen nicht als Wörter: Chinesische Schriftzeichen haben eine eigene Zeile, Kana und Hangul fließen in die Zeichenzahlen und die Lesezeit ein. Programme, die an Leerzeichen trennen (zum Beispiel Word), zählen well-known und 2024 jeweils als ein Wort, abweichende Summen sind daher normal.

Was ist der Unterschied zwischen Zeichen mit und ohne Leerzeichen, und wie viele Zeichen ist ein Emoji?

„Zeichen (mit Leerzeichen)“ zählt alles, auch Leerzeichen, Tabulatoren und jeden Zeilenumbruch; „Zeichen (ohne Leerzeichen)“ entfernt zuerst alle Leerraumzeichen (auch Leerzeichen in Vollbreite) und zählt dann. Gezählt wird nach Unicode-Codepoints, ein chinesisches Schriftzeichen oder ein einfaches Emoji zählt also als 1, kombinierte Emojis wie Varianten mit Hautfarbe, Flaggen und Familien bestehen aber aus mehreren Codepoints und zählen als 2 oder mehr. Die Zeile „Satzzeichen“ nutzt die Unicode-Kategorie für Satzzeichen, Symbole wie $, + und = sind daher keine Satzzeichen, zählen aber als Zeichen.

Was ist „Bytes (UTF-8)“, und warum weicht es von der Dateigröße ab?

Das ist die Zahl der Bytes, die der Text in UTF-8 kodiert belegt: 1 Byte für lateinische Buchstaben A–Z, Ziffern und ASCII-Satzzeichen, 2 Byte für Umlaute wie ä und für ß, 3 Byte für gängige chinesische Schriftzeichen, 4 Byte für die meisten Emojis. Hier zählt jeder Zeilenumbruch als 1 Byte, bei Dateien im Windows-Stil (\r\n) sind es 2 pro Zeilenumbruch, und eine BOM am Dateianfang fügt 3 weitere hinzu, sodass die Zahl um einige Bytes von der tatsächlichen Dateigröße abweichen kann. Bei Dateien in anderen Kodierungen wie GBK sind die Byte-Zahlen anders.

Was ist der Unterschied zwischen „Absätze“ und „Zeilen“, und warum gibt es mehr Absätze als erwartet?

„Absätze“ ist die Zahl der nicht leeren Zeilen, „Zeilen“ zählt alle Zeilen einschließlich leerer. Jeder Zeilenumbruch, auf den Text folgt, beginnt einen neuen Absatz, eine Leerzeile dazwischen ist nicht nötig; Text, der im Fenster nur umbricht, zählt nicht als zusätzliche Zeile. Eine zusätzliche Eingabetaste am Ende erhöht „Zeilen“ um 1 und lässt „Absätze“ unverändert.

Wie wird die geschätzte Lesezeit berechnet, und ist sie genau?

Chinesische Schriftzeichen, Kana und Hangul zusammen werden mit 400 pro Minute gerechnet, Wörter mit 200 pro Minute, beide Teile werden addiert; Ziffern und Satzzeichen zählen nicht. Das ist nur eine Schätzung für durchschnittliche Leser, tatsächliche Lesegeschwindigkeit und Schwierigkeit des Textes schwanken stark. Unter einer Minute wird die Zeit in Sekunden angezeigt.

Was genau ändert „Überflüssige Leerzeilen / Leerzeichen am Rand entfernen“?

Es schreibt den Text im Feld direkt um und tut drei Dinge: Es entfernt Leerraum am Anfang und Ende jeder Zeile (auch Leerzeichen in Vollbreite), fasst mehrere aufeinanderfolgende Leerzeilen zu einer zusammen und entfernt Leerzeilen ganz am Anfang und Ende des Textes. Leerzeichen innerhalb einer Zeile und einzelne Leerzeilen bleiben unberührt. Brauchst du das Original, speichere vorher eine Kopie.

Wird der eingefügte Text hochgeladen oder gespeichert?

Nein. Gezählt wird in deinem Browser; das Tool sendet keinen Text an einen Server und speichert ihn auch nicht auf deinem Gerät, nach dem erneuten Öffnen der Seite musst du ihn also noch einmal einfügen. Bei sehr langem Text (über 200.000 Zeichen) erscheinen die Zahlen etwas später.