최근 사용한 도구가 없습니다
즐겨찾기한 도구가 없습니다

텍스트 유사도 검사 무료 온라인: 두 텍스트 유사성 측정

450 회 사용

텍스트 유사도 팁

유사도 퍼센트
두 텍스트의 동일한 내용 비율을 계산합니다. 80% 이상이면 매우 유사, 30% 미만이면 관련성이 낮습니다.
편집 거리
한 텍스트를 다른 텍스트로 변환하는 데 필요한 변경 횟수를 측정합니다. 거리가 짧을수록 더 유사합니다.
공통 단어
두 텍스트 간 공유 단어와 길이 차이를 보여줍니다. 재사용된 콘텐츠나 의역을 감지하는 데 유용합니다.

자주 묻는 질문

Q 편집 거리란?
A 한 텍스트를 다른 텍스트로 변환하기 위한 최소 연산 수(삽입, 삭제, 치환). 레벤슈타인 거리라고도 합니다.
Q 붙여넣을 수 있는 최대 텍스트 크기는 얼마인가요?
A 각 텍스트 상자에 최대 5,000자까지 붙여넣을 수 있습니다. 이 제한은 대부분의 일반적인 사용 사례에서 도구가 빠르고 정확하게 작동하도록 보장합니다. 더 긴 문서를 비교하는 경우 약 2,500자 분량의 섹션으로 분할해 보세요. 이렇게 하면 각 부분에 대해 확실한 유사성 점수를 얻을 수 있습니다.
Q 두 텍스트를 바꾸면 유사도 점수가 달라지는 이유는 무엇인가요?
A 레벤슈타인 거리는 대칭적이어서 편집 횟수 자체는 변하지 않습니다. 하지만 백분율은 더 긴 텍스트의 길이를 기준으로 계산됩니다. 예를 들어 100자 텍스트와 200자 텍스트를 비교할 때 순서에 따라 값이 달라집니다. 일관된 비교를 위해 항상 동일한 순서를 유지하세요.
Q 이 도구는 모바일에서도 작동하나요?
A 네, 모바일 브라우저에서도 잘 작동합니다. 텍스트 상자가 작은 화면에 맞게 크기가 조절되므로 이동 중에도 붙여넣고 비교할 수 있습니다. 팁 하나: 휴대폰에서는 긴 텍스트를 2,000자 미만 덩어리로 나누세요. 다루기 쉬워지고 유사도 점수도 신뢰할 수 있습니다. 앱을 다운로드할 필요 없이 레이아웃이 자동으로 조정됩니다.
Q 유사도 검사기가 전체 문서를 비교하나요, 아니면 텍스트 일부만 비교하나요?
A 두 텍스트 상자에 붙여넣은 내용 그대로를 비교합니다. 파일 업로드나 문서 파싱은 없고, 순수 텍스트만 비교해요. JSON API 응답 두 개를 비교하는 기술 문서 작성자라면 각 응답을 전체로 붙여넣으세요. 도구는 상자당 5,000자까지 모든 문자를 스캔합니다. 더 긴 문서는 논리적 섹션으로 나누고, 각 쌍을 비교한 뒤 점수를 평균 내면 전체 그림을 볼 수 있습니다.
Q 단어 수준과 문자 수준의 유사도 차이가 있나요?
A 네, 흔한 오해입니다. 레벤슈타인 거리는 문자 수준에서 작동합니다 — 모든 글자, 공백, 구두점이 다 계산됩니다. 예를 들어 "안녕 세상"과 "안녕 세상"은 공백 하나 차이로 약 85% 점수가 나옵니다. 단어 수준 비교는 공백을 무시하죠. 블로그 글이나 뉴스레터 교정에는 문자 수준이 더 실용적입니다. 아주 작은 오타도 잡아냅니다. 같은 문단에서 쉼표 하나만 옮긴 두 버전을 붙여넣어 비교해보세요.
Q 매우 다른 텍스트의 유사도 백분율은 얼마나 정확한가요?
A 매우 신뢰할 수 있지만, 올바르게 해석해야 합니다. 완전히 관련 없는 두 텍스트(예: 요리 레시피와 제품 매뉴얼)는 10% 미만의 점수를 받습니다. 정확합니다. 레벤슈타인 거리는 텍스트 A를 텍스트 B로 바꾸는 데 필요한 모든 문자 변경을 셉니다. 겹치는 부분이 거의 없으면 텍스트 길이 대비 편집 거리가 엄청나게 커져 점수가 0%에 가까워집니다. 한 가지 특징: 두 텍스트 모두 짧을 경우(각 50자 미만), '그' 같은 우연한 일치만으로 점수가 15-20%까지 올라갈 수 있습니다. 아주 짧은 조각의 경우 숫자를 가볍게 받아들이세요.
Q 유사도 점수는 단순히 일치하는 문자 수의 비율인가요?
A 정확히는 아닙니다. 레벤슈타인 거리는 한 텍스트를 다른 텍스트로 바꾸는 데 필요한 최소 편집 횟수(삽입, 삭제, 대체 모두 포함)를 계산합니다. 문자 90%가 동일해도 편집 위치가 분산되면 점수가 70%에 그칠 수 있습니다. 이메일 마케터가 뉴스레터 버전을 비교할 때 중요합니다: '지금 구매'를 '오늘 주문'으로 세 곳 바꾸는 게 한 단락 전체를 다시 쓰는 것보다 편집 비용이 적습니다. 점수는 단순 문자 일치율이 아니라 구조적 비용을 반영합니다.
Q 유사도 점수에서 문장 부호와 특수 문자는 어떻게 처리되나요?
A 모든 문자가 동일하게 계산됩니다. 쉼표, 마침표, 이모지, 심지어 연속된 공백까지도 레벤슈타인 거리에 포함됩니다. 예를 들어 "먹자, 할머니"와 "먹자 할머니"를 비교하면 쉼표 하나가 없어서 점수가 약 95%로 떨어집니다. 트위터 캡션을 준비하는 카피라이터는 주의하세요. 잘못된 세미콜론이나 마침표 뒤의 여분 공백이 일치율을 낮춥니다. 이 도구는 모든 키 입력을 동등하게 취급하므로 비교 전에 텍스트를 정리하세요.
Q 두 텍스트 사이의 차이점만 가장 빠르게 확인하는 방법은?
A 유사도 퍼센트는 전체 그림만 보여주고, 구체적인 차이를 찾으려면 편집 거리 숫자를 먼저 확인하세요. 50 미만이면 거의 동일한 텍스트이므로 변경된 몇 개의 문자를 직접 찾으면 됩니다. 200 이상이면 구조적 차이가 크므로 문단별로 비교하는 게 효율적입니다. 한 가지 팁: 두 텍스트를 에디터에 나란히 붙여넣고 diff 플러그인을 사용하면 변경 부분이 색상으로 표시됩니다. 퍼센트는 텍스트 순서를 바꾸면 약간 달라지지만 편집 거리는 항상 동일하다는 점도 기억하세요.

텍스트 유사도 비교 방법

관련 도구