텍스트 및 문서 도구

길이별 단어 추출

텍스트를 붙여 넣고 범위를 정해 일치하는 단어의 첫 등장을 가져오세요.

브라우저에서 로컬 처리가입 불필요개인정보 안내 ↗

최대 50,000자이며 브라우저에서 처리합니다.

텍스트를 붙여 넣고 단어 길이 범위를 선택하세요.

단어 토큰은 Intl.Segmenter 경계를 따릅니다. 길이는 Unicode 코드 포인트이며 중복은 입력 순서의 첫 항목만 남깁니다.

사용 방법

사용 방법

  1. UTF-16 코드 단위 50,000개 이하의 텍스트를 붙여 넣습니다.
  2. 코드 포인트 1~1,000의 양 끝 포함 범위를 설정합니다.
  3. 일치하는 단어를 추출해 복사하거나 다운로드합니다.

Unicode 단어 토큰과 길이

Intl.Segmenter의 word 단위로 단어 형태의 토큰을 추출합니다. 문장 부호와 공백은 토큰이 아닙니다. 길이는 [...token].length의 Unicode 코드 포인트 기준이며 UTF-16 단위나 화면에 보이는 grapheme cluster 기준이 아닙니다.

양 끝 포함 필터와 안정적 중복 제거

최솟값과 최댓값은 1~1,000 정수이며 양 끝을 포함합니다. 입력 순서대로 처리하고 길이 조건을 통과한 뒤 완전히 같은 텍스트만 중복 제거해 첫 항목을 남깁니다. 대소문자가 다르면 별개로 유지됩니다.

로컬 처리

텍스트는 현재 브라우저 안에서 처리되며 업로드되지 않습니다. UTF-16 코드 단위 50,000개를 넘는 입력은 거부됩니다.

자주 묻는 질문

더 알아보기

길이 경계도 포함되나요?

네. Unicode 코드 포인트 길이가 어느 경계와 같은 토큰도 포함됩니다.

중복은 어떻게 제거되나요?

길이 필터를 통과한 뒤 텍스트가 완전히 같은 토큰만 제거하고 입력 순서의 첫 항목을 남깁니다. 대소문자 차이는 별개입니다.

이모지는 한 글자로 계산되나요?

Unicode 코드 포인트로 셉니다. 화면에 하나로 보이는 이모지 문자열은 여러 코드 포인트일 수 있으며 grapheme cluster로 세지 않습니다.