길이별 단어 추출
텍스트를 붙여 넣고 범위를 정해 일치하는 단어의 첫 등장을 가져오세요.
사용 방법
사용 방법
- UTF-16 코드 단위 50,000개 이하의 텍스트를 붙여 넣습니다.
- 코드 포인트 1~1,000의 양 끝 포함 범위를 설정합니다.
- 일치하는 단어를 추출해 복사하거나 다운로드합니다.
Unicode 단어 토큰과 길이
Intl.Segmenter의 word 단위로 단어 형태의 토큰을 추출합니다. 문장 부호와 공백은 토큰이 아닙니다. 길이는 [...token].length의 Unicode 코드 포인트 기준이며 UTF-16 단위나 화면에 보이는 grapheme cluster 기준이 아닙니다.
양 끝 포함 필터와 안정적 중복 제거
최솟값과 최댓값은 1~1,000 정수이며 양 끝을 포함합니다. 입력 순서대로 처리하고 길이 조건을 통과한 뒤 완전히 같은 텍스트만 중복 제거해 첫 항목을 남깁니다. 대소문자가 다르면 별개로 유지됩니다.
로컬 처리
텍스트는 현재 브라우저 안에서 처리되며 업로드되지 않습니다. UTF-16 코드 단위 50,000개를 넘는 입력은 거부됩니다.
자주 묻는 질문
더 알아보기
길이 경계도 포함되나요?
네. Unicode 코드 포인트 길이가 어느 경계와 같은 토큰도 포함됩니다.
중복은 어떻게 제거되나요?
길이 필터를 통과한 뒤 텍스트가 완전히 같은 토큰만 제거하고 입력 순서의 첫 항목을 남깁니다. 대소문자 차이는 별개입니다.
이모지는 한 글자로 계산되나요?
Unicode 코드 포인트로 셉니다. 화면에 하나로 보이는 이모지 문자열은 여러 코드 포인트일 수 있으며 grapheme cluster로 세지 않습니다.