長さで単語を抽出
テキストを貼り付け、範囲を設定して一致する単語の最初の出現を取得します。
使い方
使い方
- 最大50,000 UTF-16コード単位のテキストを貼り付けます。
- 1〜1,000コードポイントの範囲を両端込みで設定します。
- 一致した単語を抽出し、コピーまたはダウンロードします。
Unicodeの単語と長さ
Intl.Segmenterのword粒度で単語に相当する区間を抽出します。句読点と空白は単語ではありません。長さは[...token].lengthによるUnicodeコードポイント数で、UTF-16単位や表示上の書記素クラスタ数ではありません。
両端を含む絞り込みと重複除去
最小・最大値は1〜1,000の整数で、両端を含みます。入力順に走査し、長さ条件を満たした後で完全一致の重複を除き、最初の出現を残します。大文字小文字の違いは別の語として扱います。
ローカル処理
テキストは現在のブラウザー内に留まり、アップロードされません。UTF-16コード単位で50,000を超える入力は拒否されます。
よくある質問
あわせて知りたいこと
長さの境界値は含まれますか?
はい。Unicodeコードポイント長が上下限と同じ単語も含まれます。
重複はどのように除かれますか?
長さで絞り込んだ後、完全一致する語だけを重複除去し、入力順の最初を残します。大文字小文字の違いは別扱いです。
絵文字は1文字として数えますか?
Unicodeコードポイント数で数えます。表示上の絵文字列は複数のコードポイントを含むことがあり、書記素クラスタ単位では数えません。