文本相似度检查器
选择两文的多重集 Dice 词组比较、句子 Jaccard,或单文本描述统计。
使用步骤
如何使用
- 粘贴来源与待检文本;统计模式只需一段文本。
- 选择模式及适用的词组大小或阈值。
- 查看指标和逐句匹配;取消或编辑会丢弃进行中的计算。
句子词汇重合
词元为NFKC规范化后的小写Unicode字母/数字连续串。遇 . ! ? 。 ! ? 或换行分句,缩写与小数也拆分。无空格的中文、日文和韩文可能形成长词元;不提供语言专属分词或语义比较。
模式
Dice比较词组出现次数,任一文本短于n时使用单词重合。句子模式取每个待检句的最佳来源词集合Jaccard,覆盖率为达到阈值的句子比例。空集合记0且不标记。统计显示不同词元/总词元、唯一四词组/全部四词组、句子词元长度的总体标准差/均值。分母缺失或CV不足两句时显示不适用。
单文本统计
每文最多50,000个UTF-16字符、500句和5,000词元。句子模式最多250,000对,保守集合词元工作预算5,000,000,支持协作式取消。输出最多500句记录、100个Dice匹配及1,000,000字符。
文本相似度检查器
仅为词汇统计,不是语义相似度、抄袭或AI检测,也不证明原创性。不使用API、上传、网络搜索或持久存储。
常见问题
你可能还想知道
结果能认定原创性或抄袭吗?
不能。仅描述输入措辞,不产生原创性综合分数或作者身份概率。