按 locale 本土化

文本统计SG · zh-SG

一次显示六种明确指标,让 emoji、组合字符与多字节文字不会被模糊的“字符数”掩盖。

0
字素簇
0
Unicode 码点
0
UTF-16 代码单元
0
逻辑行
0
UTF-8 字节
0

使用的 locale: zh-SG. 文本仅保留在当前标签页。

可以开始。

使用方法

检查编辑限制、数据大小或文本结构,同时准确说明统计单位。

  1. 输入或粘贴文本。
  2. 查看实时更新的词、字素簇、码点、UTF-16 单元、行和 UTF-8 字节。
  3. 复制统计摘要或下载原始文本。

完整示例

输入
é😀
输出
4 个 UTF-16 代码单元;3 个 Unicode 码点;2 个字素簇;7 个 UTF-8 字节

组合重音符与字母形成一个字素;emoji 在 UTF-16 中使用代理对。

方法与定义

  • 词和字素簇使用 ECMA-402 Intl.Segmenter 及当前 locale。
  • Unicode 码点按字符串迭代统计;UTF-16 代码单元采用 JavaScript 字符串长度。
  • UTF-8 字节由 WHATWG TextEncoder 计算;空文本为 0 行。

限制与边界

  • 词边界是按 locale 调整的近似值,可能与出版社或社交平台的定义不同。
  • 不会推测阅读时间,也不会冒充某个平台的专属字数限制。
  • 输入上限为 2 MiB UTF-8。

隐私

统计只在当前标签页内存中完成,不上传,也不自动存储草稿。