文字与文档工具

按长度提取单词

粘贴文本,设置包含两端的长度范围,获取每个匹配单词的首次出现。

优先本地处理无需注册隐私说明 ↗

最多 50,000 个字符,处理在浏览器本地完成。

粘贴文本并选择单词长度范围。

词元遵循 Intl.Segmenter 的词边界。长度按 Unicode 码点计算;去重保留输入中的首次出现。

使用步骤

如何使用

  1. 粘贴不超过 50,000 个 UTF-16 代码单元的文本。
  2. 设置 1 至 1,000 的包含端点码点长度范围。
  3. 提取、复制或下载匹配词元。

Unicode 词元与长度

工具使用 Intl.Segmenter 的 word 粒度提取类词语片段;标点和空白不是词元。长度按 [...token].length 计算 Unicode 码点,不是 UTF-16 单元,也不是屏幕显示的字素簇。

包含端点过滤与稳定去重

最小值和最大值为 1 至 1,000 的整数且均包含在范围内。按输入顺序筛选;词元符合长度后才去除完全相同的重复文本,并保留首次出现。大小写不同的词分别保留。

本地处理

文本只在当前浏览器中处理,不会上传。超过 50,000 个 UTF-16 代码单元的输入会被拒绝。

常见问题

你可能还想知道

长度边界包含在内吗?

包含。码点长度等于任一边界的词元都会保留。

如何去重?

仅在长度筛选后按完全相同的词元文本去重,并保留输入顺序中的首次出现;大小写差异视为不同。

emoji 会算作一个字符吗?

按 Unicode 码点计数。可见的 emoji 序列可能由多个码点组成;不会按字素簇计数。