Язык: Русский

tools / wordcount

wordcount/

Считает китайские иероглифы, слова, символы, знаки препинания, абзацы, строки и байты UTF-8 прямо во время ввода и оценивает время чтения.

Время чтения: 400 китайских, японских и корейских знаков в минуту + 200 слов в минуту

Текст

Статистика

Абзацы — это непустые строки. Знаки препинания считаются по категории пунктуации Unicode (и CJK, и ASCII).

Частые вопросы

Как считаются «Китайские иероглифы» и учитываются ли знаки препинания, цифры, японский и корейский?

Считаются только иероглифы ханьцзы; знаки препинания, цифры и латинские буквы не входят. Кандзи в японском тексте учитываются, а кана и корейский хангыль в «Китайские иероглифы» не входят, но идут в общее число символов и во время чтения. Редкие иероглифы из расширенных блоков CJK тоже распознаются. Если нужно общее число вместе со знаками препинания, смотрите «Символы (без пробелов)».

Как считаются слова и почему результат отличается от Word?

Словом считается любая последовательность букв, не только английских: распознаются кириллица (включая ё), латинские буквы с диакритикой вроде é, ñ, ü, ß и вьетнамские буквы с тоновыми знаками (во вьетнамском каждый слог считается словом). Апостроф слово не разрывает (don't и l'été — по одному слову), слово через дефис вроде кто-то или well-known считается за два, а числа вроде 2024 словами не являются. Китайские иероглифы, японская кана и корейский хангыль словами не считаются: для иероглифов есть отдельная строка, а кана и хангыль идут в общее число символов и во время чтения. Программы, которые делят текст по пробелам, например Word, считают кто-то и 2024 по одному слову, поэтому расхождение итогов — это нормально.

Чем различаются символы с пробелами и без них и сколько символов занимает эмодзи?

«Символы (с пробелами)» — это все символы, включая пробелы, табуляцию и каждый перевод строки; в «Символы (без пробелов)» сначала удаляются все пробельные символы (в том числе полноширинные пробелы), а затем идет подсчет. Подсчет ведется по кодовым точкам Unicode, поэтому иероглиф или обычный эмодзи считается за 1, а составные эмодзи (с оттенками кожи, флаги, семьи) состоят из нескольких кодовых точек и считаются за 2 и более. Строка «Знаки препинания» использует категорию пунктуации Unicode, поэтому символы вроде $, + и = знаками препинания не являются, но входят в число символов.

Что такое «Байты (UTF-8)» и почему значение отличается от размера файла?

Это число байтов, которое занимает текст в кодировке UTF-8: 1 байт для английских букв, цифр и знаков ASCII, 2 байта для букв кириллицы, 3 для распространенных китайских, японских и корейских знаков и 4 для большинства эмодзи. Здесь каждый перевод строки считается за 1 байт, тогда как в файлах в стиле Windows (\r\n) на каждый перевод строки приходится 2 байта, а BOM в начале файла добавляет еще 3 байта, поэтому значение может на несколько байтов отличаться от реального размера файла. В файлах, сохраненных в других кодировках, например GBK или Windows-1251, число байтов будет другим.

Чем различаются «Абзацы» и «Строки» и почему абзацев больше, чем я ожидал?

«Абзацы» — это число непустых строк, а «Строки» — число всех строк, включая пустые. Любой перевод строки, после которого идет текст, начинает новый абзац, пустая строка между ними не требуется, а текст, который просто переносится в окне, лишней строкой не считается. Лишний Enter в конце добавляет 1 к «Строки» и не меняет «Абзацы».

Как рассчитывается примерное время чтения и насколько оно точно?

Иероглифы, кана и хангыль вместе считаются из расчета 400 в минуту, слова — 200 в минуту, а две части суммируются; цифры и знаки препинания не учитываются. Это лишь оценка для среднего читателя, реальная скорость чтения и сложность текста сильно различаются. Если меньше минуты, время показывается в секундах.

Что именно меняет «Убрать лишние пустые строки / пробелы по краям»?

Она напрямую переписывает текст в поле и делает три вещи: убирает пробельные символы в начале и конце каждой строки (в том числе полноширинные пробелы), сжимает несколько пустых строк подряд в одну и удаляет пустые строки в самом начале и конце текста. Пробелы внутри строки и одиночные пустые строки не затрагиваются. Если нужен оригинал, сначала сохраните копию.

Отправляется ли вставленный текст на сервер и сохраняется ли он?

Нет. Подсчет выполняется в браузере: инструмент не отправляет текст на сервер и не сохраняет его на вашем устройстве, поэтому после повторного открытия страницы текст нужно вставить снова. Если текст очень длинный (больше 200 000 символов), результат появляется чуть позже.