長い単語を抽出
テキストを貼り付けて最小長を選び、長い単語をローカルで一覧表示します。
使い方
使い方
- スキャンするテキストを貼り付けます。
- 単語の最小長を 1~1,000 Unicode コードポイントで指定します。
- 条件に合う重複なしの単語を抽出し、コピーまたはダウンロードします。
Unicode の単語と長さの規則
利用可能な場合は Intl.Segmenter の単語らしい区切りを使い、Unicode の文字または数字を含む語を対象にします。長さはコードポイント数です。補助文字は 1、結合文字は別に数えます。分割機能がない場合は保守的な Unicode 文字・数字の規則を使います。
重複なしで順序を維持
大文字小文字とアクセントを含むテキスト完全一致で重複を除き、最初の表記と出現位置を残します。結果は長い順で、同じ長さは初出順です。処理はブラウザー内で行い、入力は UTF-16 コード単位で最大 100,000 です。
よくある質問
あわせて知りたいこと
長さはどう数えますか?
UTF-16 コード単位や表示上の書記素クラスタではなく Unicode コードポイントで数えます。補助文字は 1、基底文字と結合文字は合わせて 2 です。
重複は除去されますか?
はい。完全一致は初出順で一度だけ表示し、大文字小文字とアクセントは区別します。
どの順序で表示されますか?
長い単語が先です。同じ長さの場合は最初に見つかった順になります。