テキストと文書ツール

長さで単語を抽出

テキストを貼り付け、範囲を設定して一致する単語の最初の出現を取得します。

ブラウザ内で処理登録不要プライバシーの説明 ↗

最大 50,000 文字。ブラウザー内で処理します。

テキストを貼り付けて長さの範囲を選びます。

単語トークンは Intl.Segmenter の境界に従います。長さは Unicode コードポイントで数え、重複は入力順の最初を残します。

使い方

使い方

  1. 最大50,000 UTF-16コード単位のテキストを貼り付けます。
  2. 1〜1,000コードポイントの範囲を両端込みで設定します。
  3. 一致した単語を抽出し、コピーまたはダウンロードします。

Unicodeの単語と長さ

Intl.Segmenterのword粒度で単語に相当する区間を抽出します。句読点と空白は単語ではありません。長さは[...token].lengthによるUnicodeコードポイント数で、UTF-16単位や表示上の書記素クラスタ数ではありません。

両端を含む絞り込みと重複除去

最小・最大値は1〜1,000の整数で、両端を含みます。入力順に走査し、長さ条件を満たした後で完全一致の重複を除き、最初の出現を残します。大文字小文字の違いは別の語として扱います。

ローカル処理

テキストは現在のブラウザー内に留まり、アップロードされません。UTF-16コード単位で50,000を超える入力は拒否されます。

よくある質問

あわせて知りたいこと

長さの境界値は含まれますか?

はい。Unicodeコードポイント長が上下限と同じ単語も含まれます。

重複はどのように除かれますか?

長さで絞り込んだ後、完全一致する語だけを重複除去し、入力順の最初を残します。大文字小文字の違いは別扱いです。

絵文字は1文字として数えますか?

Unicodeコードポイント数で数えます。表示上の絵文字列は複数のコードポイントを含むことがあり、書記素クラスタ単位では数えません。