Teksto at mga dokumento na tool

Mag-extract ng Salita ayon sa Haba

Mag-paste ng text, magtakda ng inclusive range, at kunin ang unang paglitaw ng bawat tugmang salita.

Lokal na pinoproseso sa browserHindi kailangan ng accountMga detalye ng pagkapribado ↗

Hanggang 50,000 character. Lokal sa browser ang pagproseso.

Mag-paste ng teksto at pumili ng saklaw ng haba.

Ang word token ay sumusunod sa hangganan ng Intl.Segmenter. Unicode code point ang haba; iniiwan ng deduplication ang unang paglitaw ayon sa input.

Paano gamitin

Paano gamitin

  1. Mag-paste ng text na hanggang 50,000 UTF-16 code unit.
  2. Magtakda ng inclusive na haba na 1–1,000 Unicode code point.
  3. I-extract, kopyahin, o i-download ang mga tugmang salita.

Unicode word token at haba

Kinukuha ang mga bahaging kahawig ng salita gamit ang word granularity ng Intl.Segmenter. Hindi token ang bantas at whitespace. Unicode code point ang haba gamit ang [...token].length, hindi UTF-16 unit o ipinapakitang grapheme cluster.

Inclusive na filter at matatag na deduplication

Inclusive na integer mula 1 hanggang 1,000 ang minimum at maximum. Sinusuri ayon sa ayos ng input; pagkatapos pumasa sa haba, eksaktong duplicate lang ang inaalis at ang unang paglitaw ang naiiwan. Magkahiwalay ang magkaibang malaking/maliit na titik.

Lokal na pagproseso

Nananatili sa browser ang text at hindi ito ina-upload. Tinatanggihan ang input na lampas 50,000 UTF-16 code unit.

Mga madalas itanong

Maaari mo ring alamin

Kasama ba ang haba sa mga hangganan?

Oo. Kasama ang token na ang Unicode code-point length ay katumbas ng alinmang hangganan.

Paano inaalis ang duplicate?

Pagkatapos ng length filter, eksaktong magkaparehong token lang ang inaalis at iniiwan ang unang lumitaw ayon sa input. Magkahiwalay ang case variant.

Isang character ba ang emoji?

Unicode code point ang binibilang. Maaaring maraming code point ang isang nakikitang emoji sequence; hindi grapheme cluster ang panukat.