テキスト類似度チェッカー
2文章の多重集合Dice、文単位Jaccard、または1文章の記述統計を選択します。
使い方
使い方
- 元の文章と確認する文章、統計では1つの文章を貼り付けます。
- モードと該当するn-gramサイズかしきい値を設定します。
- 指標と文ごとの一致を確認します。キャンセルや編集で実行中の計算を破棄します。
文単位の語彙重複
トークンはNFKC正規化した小文字のUnicode文字・数字の連続です。. ! ? 。 ! ? または改行で分割し、略語や小数も分割します。空白のない中国語、日本語、韓国語では長いトークンになり、言語別の単語分割や意味比較はありません。
モード
Diceはn-gramの出現数を比較し、片方がn未満なら単語の重なりを使います。各確認文の最大Jaccardを取り、しきい値以上の割合を表示します。空集合は0で一致扱いにしません。統計は異なるトークン/全トークン、固有4トークン組/全組、文のトークン長の母標準偏差/平均です。分母なし、またはCVの文が2つ未満なら該当なしです。
1文章の統計
各文章は50,000 UTF-16文字、500文、5,000トークンまで。文モードは250,000ペア、保守的な集合トークン処理予算5,000,000までで、協調的キャンセルに対応します。出力は500文行、100 Dice一致、1,000,000文字までです。
テキスト類似度チェッカー
語彙統計であり、意味の類似、盗用・AI検出、独創性の証明ではありません。API、アップロード、ウェブ検索、永続保存は使いません。
よくある質問
あわせて知りたいこと
独創性や盗用を確定できますか?
いいえ。入力の語句を記述するだけで、独創性の総合スコアや著者の確率は出力しません。