텍스트 유사도 검사 무료 온라인: 두 텍스트 유사성 측정
450 회 사용텍스트 유사도 팁
유사도 퍼센트
두 텍스트의 동일한 내용 비율을 계산합니다. 80% 이상이면 매우 유사, 30% 미만이면 관련성이 낮습니다.
편집 거리
한 텍스트를 다른 텍스트로 변환하는 데 필요한 변경 횟수를 측정합니다. 거리가 짧을수록 더 유사합니다.
공통 단어
두 텍스트 간 공유 단어와 길이 차이를 보여줍니다. 재사용된 콘텐츠나 의역을 감지하는 데 유용합니다.
자주 묻는 질문
편집 거리란?
한 텍스트를 다른 텍스트로 변환하기 위한 최소 연산 수(삽입, 삭제, 치환). 레벤슈타인 거리라고도 합니다.
붙여넣을 수 있는 최대 텍스트 크기는 얼마인가요?
각 텍스트 상자에 최대 5,000자까지 붙여넣을 수 있습니다. 이 제한은 대부분의 일반적인 사용 사례에서 도구가 빠르고 정확하게 작동하도록 보장합니다. 더 긴 문서를 비교하는 경우 약 2,500자 분량의 섹션으로 분할해 보세요. 이렇게 하면 각 부분에 대해 확실한 유사성 점수를 얻을 수 있습니다.
두 텍스트를 바꾸면 유사도 점수가 달라지는 이유는 무엇인가요?
레벤슈타인 거리는 대칭적이어서 편집 횟수 자체는 변하지 않습니다. 하지만 백분율은 더 긴 텍스트의 길이를 기준으로 계산됩니다. 예를 들어 100자 텍스트와 200자 텍스트를 비교할 때 순서에 따라 값이 달라집니다. 일관된 비교를 위해 항상 동일한 순서를 유지하세요.
이 도구는 모바일에서도 작동하나요?
네, 모바일 브라우저에서도 잘 작동합니다. 텍스트 상자가 작은 화면에 맞게 크기가 조절되므로 이동 중에도 붙여넣고 비교할 수 있습니다. 팁 하나: 휴대폰에서는 긴 텍스트를 2,000자 미만 덩어리로 나누세요. 다루기 쉬워지고 유사도 점수도 신뢰할 수 있습니다. 앱을 다운로드할 필요 없이 레이아웃이 자동으로 조정됩니다.
유사도 검사기가 전체 문서를 비교하나요, 아니면 텍스트 일부만 비교하나요?
두 텍스트 상자에 붙여넣은 내용 그대로를 비교합니다. 파일 업로드나 문서 파싱은 없고, 순수 텍스트만 비교해요. JSON API 응답 두 개를 비교하는 기술 문서 작성자라면 각 응답을 전체로 붙여넣으세요. 도구는 상자당 5,000자까지 모든 문자를 스캔합니다. 더 긴 문서는 논리적 섹션으로 나누고, 각 쌍을 비교한 뒤 점수를 평균 내면 전체 그림을 볼 수 있습니다.
단어 수준과 문자 수준의 유사도 차이가 있나요?
네, 흔한 오해입니다. 레벤슈타인 거리는 문자 수준에서 작동합니다 — 모든 글자, 공백, 구두점이 다 계산됩니다. 예를 들어 "안녕 세상"과 "안녕 세상"은 공백 하나 차이로 약 85% 점수가 나옵니다. 단어 수준 비교는 공백을 무시하죠. 블로그 글이나 뉴스레터 교정에는 문자 수준이 더 실용적입니다. 아주 작은 오타도 잡아냅니다. 같은 문단에서 쉼표 하나만 옮긴 두 버전을 붙여넣어 비교해보세요.
매우 다른 텍스트의 유사도 백분율은 얼마나 정확한가요?
매우 신뢰할 수 있지만, 올바르게 해석해야 합니다. 완전히 관련 없는 두 텍스트(예: 요리 레시피와 제품 매뉴얼)는 10% 미만의 점수를 받습니다. 정확합니다. 레벤슈타인 거리는 텍스트 A를 텍스트 B로 바꾸는 데 필요한 모든 문자 변경을 셉니다. 겹치는 부분이 거의 없으면 텍스트 길이 대비 편집 거리가 엄청나게 커져 점수가 0%에 가까워집니다. 한 가지 특징: 두 텍스트 모두 짧을 경우(각 50자 미만), '그' 같은 우연한 일치만으로 점수가 15-20%까지 올라갈 수 있습니다. 아주 짧은 조각의 경우 숫자를 가볍게 받아들이세요.
유사도 점수는 단순히 일치하는 문자 수의 비율인가요?
정확히는 아닙니다. 레벤슈타인 거리는 한 텍스트를 다른 텍스트로 바꾸는 데 필요한 최소 편집 횟수(삽입, 삭제, 대체 모두 포함)를 계산합니다. 문자 90%가 동일해도 편집 위치가 분산되면 점수가 70%에 그칠 수 있습니다. 이메일 마케터가 뉴스레터 버전을 비교할 때 중요합니다: '지금 구매'를 '오늘 주문'으로 세 곳 바꾸는 게 한 단락 전체를 다시 쓰는 것보다 편집 비용이 적습니다. 점수는 단순 문자 일치율이 아니라 구조적 비용을 반영합니다.
유사도 점수에서 문장 부호와 특수 문자는 어떻게 처리되나요?
모든 문자가 동일하게 계산됩니다. 쉼표, 마침표, 이모지, 심지어 연속된 공백까지도 레벤슈타인 거리에 포함됩니다. 예를 들어 "먹자, 할머니"와 "먹자 할머니"를 비교하면 쉼표 하나가 없어서 점수가 약 95%로 떨어집니다. 트위터 캡션을 준비하는 카피라이터는 주의하세요. 잘못된 세미콜론이나 마침표 뒤의 여분 공백이 일치율을 낮춥니다. 이 도구는 모든 키 입력을 동등하게 취급하므로 비교 전에 텍스트를 정리하세요.
두 텍스트 사이의 차이점만 가장 빠르게 확인하는 방법은?
유사도 퍼센트는 전체 그림만 보여주고, 구체적인 차이를 찾으려면 편집 거리 숫자를 먼저 확인하세요. 50 미만이면 거의 동일한 텍스트이므로 변경된 몇 개의 문자를 직접 찾으면 됩니다. 200 이상이면 구조적 차이가 크므로 문단별로 비교하는 게 효율적입니다. 한 가지 팁: 두 텍스트를 에디터에 나란히 붙여넣고 diff 플러그인을 사용하면 변경 부분이 색상으로 표시됩니다. 퍼센트는 텍스트 순서를 바꾸면 약간 달라지지만 편집 거리는 항상 동일하다는 점도 기억하세요.
텍스트 유사도 비교 방법
- 텍스트 1 필드에 첫 번째 텍스트를 붙여넣으세요
- 텍스트 2 필드에 두 번째 텍스트를 붙여넣으세요
- 비교 버튼을 클릭하면 결과가 표시됩니다
- 유사도 퍼센트, 편집 거리, 공통 단어가 표시됩니다