पाठ और दस्तावेज़ टूल

टेक्स्ट समानता जाँचक

दो टेक्स्ट के multiset Dice n-gram, वाक्य Jaccard या एक टेक्स्ट के वर्णनात्मक आँकड़े चुनें।

ब्राउज़र में ही कामखाता बनाने की ज़रूरत नहींगोपनीयता विवरण ↗

आवश्यक फ़ील्ड में टेक्स्ट दर्ज करें।

वाक्य शब्दावली ओवरलैप: टोकन NFKC सामान्यीकृत छोटे अक्षरों वाले लगातार Unicode अक्षर/अंक हैं। . ! ? 。 ! ? या नई पंक्ति पर वाक्य अलग होते हैं; संक्षेप और दशमलव भी टूटते हैं। बिना स्पेस की चीनी, जापानी और कोरियाई सामग्री लंबे टोकन बना सकती है; भाषा-विशिष्ट विभाजन या अर्थ तुलना नहीं है।

मोड: Dice n-gram आवृत्ति तुलना करता है; किसी टेक्स्ट के n से छोटा होने पर unigram ओवरलैप है। हर जाँचे वाक्य का अधिकतम स्रोत-सेट Jaccard और सीमा पूरी करने वाले वाक्यों का अनुपात दिखता है। खाली सेट0 और मिलान नहीं। आँकड़े: अलग/कुल टोकन, अलग/कुल चार-टोकन समूह और वाक्य टोकन लंबाई का जनसंख्या मानक विचलन/औसत। अनुपस्थित भाजक या दो से कम CV नमूनों पर उपलब्ध नहीं है।

एक टेक्स्ट के आँकड़े: हर टेक्स्ट:50,000 UTF-16 वर्ण,500 वाक्य,5,000 टोकन। वाक्य मोड:250,000 जोड़े और रूढ़िवादी सेट-टोकन कार्य बजट5,000,000, सहकारी रद्द करने की सुविधा। परिणाम:500 वाक्य पंक्तियाँ,100 Dice मिलान और1,000,000 वर्ण।

टेक्स्ट समानता जाँचक: ये शब्दावली आँकड़े हैं, अर्थ समानता, साहित्यिक चोरी या AI पहचान और मौलिकता का प्रमाण नहीं। API, अपलोड, वेब खोज या स्थायी स्टोरेज नहीं है।

उपयोग कैसे करें

उपयोग कैसे करें

  1. स्रोत और जाँच वाला टेक्स्ट लिखें; आँकड़ों के लिए एक टेक्स्ट चाहिए।
  2. मोड और लागू n-gram आकार या सीमा चुनें।
  3. माप और वाक्य मिलान देखें। रद्द या संपादन से जारी गणना हटती है।

वाक्य शब्दावली ओवरलैप

टोकन NFKC सामान्यीकृत छोटे अक्षरों वाले लगातार Unicode अक्षर/अंक हैं। . ! ? 。 ! ? या नई पंक्ति पर वाक्य अलग होते हैं; संक्षेप और दशमलव भी टूटते हैं। बिना स्पेस की चीनी, जापानी और कोरियाई सामग्री लंबे टोकन बना सकती है; भाषा-विशिष्ट विभाजन या अर्थ तुलना नहीं है।

मोड

Dice n-gram आवृत्ति तुलना करता है; किसी टेक्स्ट के n से छोटा होने पर unigram ओवरलैप है। हर जाँचे वाक्य का अधिकतम स्रोत-सेट Jaccard और सीमा पूरी करने वाले वाक्यों का अनुपात दिखता है। खाली सेट0 और मिलान नहीं। आँकड़े: अलग/कुल टोकन, अलग/कुल चार-टोकन समूह और वाक्य टोकन लंबाई का जनसंख्या मानक विचलन/औसत। अनुपस्थित भाजक या दो से कम CV नमूनों पर उपलब्ध नहीं है।

एक टेक्स्ट के आँकड़े

हर टेक्स्ट:50,000 UTF-16 वर्ण,500 वाक्य,5,000 टोकन। वाक्य मोड:250,000 जोड़े और रूढ़िवादी सेट-टोकन कार्य बजट5,000,000, सहकारी रद्द करने की सुविधा। परिणाम:500 वाक्य पंक्तियाँ,100 Dice मिलान और1,000,000 वर्ण।

टेक्स्ट समानता जाँचक

ये शब्दावली आँकड़े हैं, अर्थ समानता, साहित्यिक चोरी या AI पहचान और मौलिकता का प्रमाण नहीं। API, अपलोड, वेब खोज या स्थायी स्टोरेज नहीं है।

अक्सर पूछे जाने वाले सवाल

आप यह भी जानना चाहेंगे

क्या मौलिकता या साहित्यिक चोरी सिद्ध होती है?

नहीं। केवल दिए शब्दों का विवरण है; संयुक्त मौलिकता स्कोर या लेखक संभावना नहीं बनती।