tools / wordcount
wordcount/
Thống kê theo thời gian thực chữ Hán, số từ, ký tự, dấu câu, đoạn văn, số dòng, số byte UTF-8 và ước tính thời gian đọc.
Văn bản
Thống kê
Đoạn văn = số dòng không trống; dấu câu được tính theo nhóm dấu câu của Unicode (gồm cả dấu câu CJK và ASCII).
Câu hỏi thường gặp
Mục "Chữ Hán" được đếm thế nào, dấu câu, chữ số, tiếng Nhật và tiếng Hàn có được tính không
Chỉ đếm chữ Hán; dấu câu, chữ số và chữ cái Latin không được tính. Chữ Hán trong tiếng Nhật (kanji) được tính, còn kana và hangul của tiếng Hàn không được tính vào "Chữ Hán" nhưng vẫn tính vào số ký tự và thời gian đọc. Các chữ Hán hiếm thuộc vùng mở rộng cũng được nhận diện. Muốn có tổng số kể cả dấu câu, hãy xem "Ký tự (không có dấu cách)".
Số từ được đếm thế nào, vì sao khác với Word
Mỗi chuỗi chữ cái liền nhau được tính là 1 từ, không chỉ tiếng Anh: chữ cái Latin như é, ñ, ü, ß, chữ Kirin và chữ tiếng Việt có dấu thanh đều được nhận diện. Với tiếng Việt, mỗi tiếng (âm tiết) viết cách nhau tính là 1 từ, ví dụ "học sinh" là 2 từ. Dấu nháy đơn không tách từ (don't, l'été mỗi từ tính là 1), từ nối bằng dấu gạch nối (well-known) tính là 2, số thuần túy (2024) không phải từ. Chữ Hán, kana tiếng Nhật và hangul tiếng Hàn không được tính là từ: chữ Hán được đếm riêng ở mục "Chữ Hán", còn kana và hangul được tính vào số ký tự và thời gian đọc. Phần mềm tách từ theo dấu cách (như Word) sẽ tính cả well-known và 2024 là một từ, nên tổng số không khớp là chuyện bình thường.
Khác nhau thế nào giữa "Ký tự (có dấu cách)" và "Ký tự (không có dấu cách)", emoji được tính là mấy ký tự
"Ký tự (có dấu cách)" là toàn bộ ký tự, kể cả dấu cách, tab và từng dấu xuống dòng; "Ký tự (không có dấu cách)" bỏ hết ký tự khoảng trắng trước (kể cả dấu cách toàn chiều rộng) rồi mới đếm. Việc đếm theo điểm mã Unicode, nên một chữ Hán hoặc một emoji thông thường tính là 1, nhưng các emoji ghép như biến thể màu da, cờ quốc gia, gia đình được ghép từ nhiều điểm mã nên tính là 2 trở lên. Dòng "Dấu câu" tính theo nhóm dấu câu của Unicode, các ký hiệu như $, +, = không phải dấu câu nhưng vẫn tính là ký tự.
Mục "Byte UTF-8" là gì, vì sao không khớp với dung lượng tệp
Đó là số byte mà văn bản chiếm khi mã hóa theo UTF-8: chữ cái không dấu, chữ số và dấu câu ASCII mỗi ký tự 1 byte, chữ cái tiếng Việt có dấu 2 hoặc 3 byte, chữ Hán, Nhật, Hàn thông dụng 3 byte, đa số emoji 4 byte. Ở đây mỗi dấu xuống dòng chỉ tính 1 byte, trong khi tệp kiểu Windows (\r\n) mỗi dấu xuống dòng là 2 byte, và nếu đầu tệp có BOM thì thêm 3 byte nữa, nên con số có thể chênh vài byte so với dung lượng tệp thực tế. Tệp lưu bằng bảng mã khác như GBK thì số byte sẽ khác.
Khác nhau thế nào giữa "Đoạn văn" và "Số dòng", vì sao số đoạn nhiều hơn tôi nghĩ
Số đoạn là số dòng không trống, "Số dòng" là tất cả các dòng (kể cả dòng trống). Chỉ cần xuống dòng và dòng kế tiếp có chữ là tính một đoạn mới, không yêu cầu cách một dòng trống ở giữa; một đoạn văn tự động xuống dòng trong cửa sổ thì không bị tính thêm dòng. Nhấn thêm một lần Enter ở cuối, số dòng tăng 1 còn số đoạn không đổi.
Thời gian đọc dự kiến được tính thế nào, có chính xác không
Chữ Hán, kana và hangul cộng lại tính 400 ký tự mỗi phút, các từ tính 200 từ mỗi phút, rồi cộng hai phần lại; chữ số và dấu câu không tính. Đây chỉ là ước tính cho người đọc trung bình, tốc độ đọc thực tế và độ khó của bài chênh lệch rất nhiều. Dưới 1 phút thì hiển thị bằng giây.
Mục "Xóa dòng trống thừa / khoảng trắng đầu cuối dòng" làm thay đổi những gì
Nó viết lại trực tiếp văn bản trong ô nhập và làm ba việc: bỏ khoảng trắng ở đầu và cuối mỗi dòng (kể cả dấu cách toàn chiều rộng), nén nhiều dòng trống liên tiếp thành một, rồi bỏ các dòng trống ở đầu và cuối toàn bộ văn bản. Dấu cách trong dòng và các dòng trống đơn lẻ không bị đụng tới. Nếu cần giữ bản gốc, hãy tự sao lưu trước.
Văn bản tôi dán vào có bị tải lên hoặc lưu lại không
Không. Việc thống kê chạy trong trình duyệt, công cụ không gửi bất kỳ văn bản nào lên máy chủ và cũng không lưu nội dung trên máy, nên sau khi mở lại trang bạn phải dán lại. Khi văn bản rất dài (trên 200.000 ký tự), kết quả sẽ hiện chậm hơn một chút.