テキストと文書ツール

長い単語を抽出

テキストを貼り付けて最小長を選び、長い単語をローカルで一覧表示します。

ブラウザ内で処理登録不要プライバシーの説明 ↗

Words use Unicode word boundaries; length counts Unicode code points. Duplicate words are listed once.

使い方

使い方

  1. スキャンするテキストを貼り付けます。
  2. 単語の最小長を 1~1,000 Unicode コードポイントで指定します。
  3. 条件に合う重複なしの単語を抽出し、コピーまたはダウンロードします。

Unicode の単語と長さの規則

利用可能な場合は Intl.Segmenter の単語らしい区切りを使い、Unicode の文字または数字を含む語を対象にします。長さはコードポイント数です。補助文字は 1、結合文字は別に数えます。分割機能がない場合は保守的な Unicode 文字・数字の規則を使います。

重複なしで順序を維持

大文字小文字とアクセントを含むテキスト完全一致で重複を除き、最初の表記と出現位置を残します。結果は長い順で、同じ長さは初出順です。処理はブラウザー内で行い、入力は UTF-16 コード単位で最大 100,000 です。

よくある質問

あわせて知りたいこと

長さはどう数えますか?

UTF-16 コード単位や表示上の書記素クラスタではなく Unicode コードポイントで数えます。補助文字は 1、基底文字と結合文字は合わせて 2 です。

重複は除去されますか?

はい。完全一致は初出順で一度だけ表示し、大文字小文字とアクセントは区別します。

どの順序で表示されますか?

長い単語が先です。同じ長さの場合は最初に見つかった順になります。