लंबाई के अनुसार शब्द निकालें
टेक्स्ट पेस्ट करें, सीमा तय करें और हर मेल खाते शब्द की पहली उपस्थिति पाएँ।
उपयोग कैसे करें
उपयोग कैसे करें
- 50,000 UTF-16 code units तक का पाठ पेस्ट करें।
- 1–1,000 Unicode code points की समावेशी सीमा तय करें।
- मेल खाते शब्द निकालें, कॉपी करें या डाउनलोड करें।
Unicode शब्द टोकन और लंबाई
Intl.Segmenter के word granularity से शब्द-जैसे खंड निकाले जाते हैं। विराम-चिह्न और whitespace टोकन नहीं हैं। लंबाई [...token].length के Unicode code points से मापी जाती है, UTF-16 units या दिखने वाले grapheme cluster से नहीं।
समावेशी फ़िल्टर और स्थिर डुप्लिकेट हटाना
न्यूनतम और अधिकतम 1–1,000 के पूर्णांक हैं और दोनों सीमाएँ शामिल हैं। इनपुट क्रम में जाँच होती है; लंबाई में पास होने के बाद बिल्कुल समान पाठ हटाकर पहली उपस्थिति रखी जाती है। बड़े/छोटे अक्षर अलग माने जाते हैं।
स्थानीय प्रसंस्करण
पाठ इसी ब्राउज़र में रहता है और अपलोड नहीं होता। 50,000 UTF-16 code units से बड़ा इनपुट अस्वीकार है।
अक्सर पूछे जाने वाले सवाल
आप यह भी जानना चाहेंगे
क्या सीमा मान शामिल हैं?
हाँ। जिस टोकन की Unicode code-point लंबाई किसी भी सीमा के बराबर हो, वह शामिल होता है।
डुप्लिकेट कैसे हटते हैं?
लंबाई फ़िल्टर के बाद केवल बिल्कुल समान टोकन हटते हैं और इनपुट क्रम की पहली उपस्थिति रहती है। अक्षर-केस अलग माना जाता है।
क्या emoji एक अक्षर गिना जाता है?
Unicode code points गिने जाते हैं। दिखने वाली emoji श्रृंखला में कई code points हो सकते हैं; grapheme cluster नहीं गिने जाते।