长词提取器
粘贴文本并设置最小长度,在本地列出较长的词。
使用步骤
如何使用
- 粘贴要扫描的文本。
- 选择每个词的最小长度,范围为 1–1,000 个 Unicode 码点。
- 提取符合条件的唯一词,再复制或下载结果。
Unicode 分词与长度规则
如果浏览器支持 Intl.Segmenter,就使用其识别的词语片段,并要求片段中含有 Unicode 字母或数字。长度按 Unicode 码点计数:补充平面字符算一个码点,组合附加符号另算一个。若无法分词,则使用保守的 Unicode 字母/数字规则作为回退。
唯一结果与稳定顺序
按文本完全相同去重,大小写和重音符号均有区别;保留首次出现的拼写和位置。结果按长度从长到短排列,长度相同则保持首次出现顺序。处理在浏览器中进行,输入上限为 100,000 个 UTF-16 代码单元。
常见问题
你可能还想知道
长度如何计算?
按 Unicode 码点计数,而不是 UTF-16 代码单元或用户看到的字形簇。补充字符算一个码点;基础字符和组合附加符号算两个。
会去除重复词吗?
会。完全相同的文本只列一次,并保留首次出现顺序;大小写和重音差异仍视为不同。
结果按什么顺序排列?
较长的词排在前面;长度相同时按首次匹配的顺序排列。