文字与文档工具

长词提取器

粘贴文本并设置最小长度,在本地列出较长的词。

优先本地处理无需注册隐私说明 ↗

Words use Unicode word boundaries; length counts Unicode code points. Duplicate words are listed once.

使用步骤

如何使用

  1. 粘贴要扫描的文本。
  2. 选择每个词的最小长度,范围为 1–1,000 个 Unicode 码点。
  3. 提取符合条件的唯一词,再复制或下载结果。

Unicode 分词与长度规则

如果浏览器支持 Intl.Segmenter,就使用其识别的词语片段,并要求片段中含有 Unicode 字母或数字。长度按 Unicode 码点计数:补充平面字符算一个码点,组合附加符号另算一个。若无法分词,则使用保守的 Unicode 字母/数字规则作为回退。

唯一结果与稳定顺序

按文本完全相同去重,大小写和重音符号均有区别;保留首次出现的拼写和位置。结果按长度从长到短排列,长度相同则保持首次出现顺序。处理在浏览器中进行,输入上限为 100,000 个 UTF-16 代码单元。

常见问题

你可能还想知道

长度如何计算?

按 Unicode 码点计数,而不是 UTF-16 代码单元或用户看到的字形簇。补充字符算一个码点;基础字符和组合附加符号算两个。

会去除重复词吗?

会。完全相同的文本只列一次,并保留首次出现顺序;大小写和重音差异仍视为不同。

结果按什么顺序排列?

较长的词排在前面;长度相同时按首次匹配的顺序排列。