텍스트 유사도 검사기
두 텍스트의 다중집합 Dice, 문장 Jaccard 또는 단일 텍스트 기술 통계를 선택하세요.
사용 방법
사용 방법
- 원문과 검사할 텍스트를 입력하세요. 통계는 한 텍스트만 필요합니다.
- 모드와 해당 n-그램 크기 또는 임계값을 선택하세요.
- 지표와 문장별 일치를 확인하세요. 취소나 편집은 진행 중 계산을 폐기합니다.
문장 어휘 중복
토큰은 NFKC 정규화 후 소문자 Unicode 문자·숫자의 연속입니다. . ! ? 。 ! ? 또는 줄바꿈으로 나누며 약어와 소수도 분리됩니다. 띄어쓰기 없는 중국어·일본어·한국어는 긴 토큰이 될 수 있습니다. 언어별 분할이나 의미 비교는 제공하지 않습니다.
모드
Dice는 n-그램 횟수를 비교하며 한 텍스트라도 n보다 짧으면 단어 중복을 사용합니다. 각 검사 문장의 최대 Jaccard를 구하고 임계값 이상인 문장 비율을 표시합니다. 빈 집합은 0이며 일치 표시하지 않습니다. 통계는 고유/전체 토큰, 고유 4토큰 묶음/전체 묶음, 문장 토큰 길이의 모집단 표준편차/평균입니다. 분모가 없거나 CV 표본이 두 문장 미만이면 해당 없음입니다.
단일 텍스트 통계
텍스트당 50,000 UTF-16자, 500문장, 5,000토큰까지입니다. 문장 모드는 250,000쌍과 보수적 집합 토큰 작업 예산 5,000,000까지이며 협력적 취소를 지원합니다. 출력은 500문장 행, 100 Dice 일치 및 1,000,000자까지입니다.
텍스트 유사도 검사기
어휘 통계이며 의미 유사도, 표절·AI 탐지 또는 독창성 증명이 아닙니다. API, 업로드, 웹 검색이나 영구 저장을 사용하지 않습니다.
자주 묻는 질문
더 알아보기
독창성이나 표절을 확정하나요?
아니요. 입력 문구를 설명할 뿐 독창성 종합 점수나 저자 확률을 생성하지 않습니다.