按长度提取单词
粘贴文本,设置包含两端的长度范围,获取每个匹配单词的首次出现。
使用步骤
如何使用
- 粘贴不超过 50,000 个 UTF-16 代码单元的文本。
- 设置 1 至 1,000 的包含端点码点长度范围。
- 提取、复制或下载匹配词元。
Unicode 词元与长度
工具使用 Intl.Segmenter 的 word 粒度提取类词语片段;标点和空白不是词元。长度按 [...token].length 计算 Unicode 码点,不是 UTF-16 单元,也不是屏幕显示的字素簇。
包含端点过滤与稳定去重
最小值和最大值为 1 至 1,000 的整数且均包含在范围内。按输入顺序筛选;词元符合长度后才去除完全相同的重复文本,并保留首次出现。大小写不同的词分别保留。
本地处理
文本只在当前浏览器中处理,不会上传。超过 50,000 个 UTF-16 代码单元的输入会被拒绝。
常见问题
你可能还想知道
长度边界包含在内吗?
包含。码点长度等于任一边界的词元都会保留。
如何去重?
仅在长度筛选后按完全相同的词元文本去重,并保留输入顺序中的首次出现;大小写差异视为不同。
emoji 会算作一个字符吗?
按 Unicode 码点计数。可见的 emoji 序列可能由多个码点组成;不会按字素簇计数。