본문으로 건너뛰기
유환호 연락하기

홈 / 기록

영어판이 늘어나자 한국어 글이 영어 페이지와 비교되고 있었다

한눈에 답변

새 콘텐츠 후보가 기존 글과 얼마나 겹치는지 판정하는 로직에 언어 구분이 없었다. 영어판이 97장으로 늘면서 대조 대상의 45%가 영어 문서가 됐고, 한국어 질의가 영어 문서와 비교되며 알파벳 토큰만으로 유사도 점수가 붙고 있었다. 실측해 보니 같은 후보가 엉뚱한 영어 페이지와 비교될 때는 겹침 점수가 부풀고, 언어를 맞춰 비교하자 같은 업종의 한국어 페이지와 타당한 점수로 비교됐다. 판정 기준을 느슨하게 만든 것이 아니라 비교 대상을 올바르게 좁힌 것이다.

무엇이 어긋나 있었나

새로운 글감 후보가 기존에 발행된 글과 얼마나 겹치는지 확인하는 절차가 있다. 이 절차가 참고하는 기존 문서 색인에 언어 구분이 없었다. 영어판이 늘어나면서 전체 색인의 거의 절반이 영어 문서가 됐는데, 한국어로 된 새 후보가 그 영어 문서들과 비교되고 있었다.

왜 이게 잘못된 비교인가

언어가 다른 두 문서를 비교하면, 실제 의미가 겹치는지와 무관하게 알파벳으로 된 전문 용어 같은 공통 토큰만으로 유사도 점수가 붙는다. 실제로 특정 업종 관련 후보를 확인해 보니, 고치기 전에는 엉뚱한 영어 페이지와 비교돼 겹침 점수가 실제보다 높게 나왔다.

언어를 맞추면 무엇이 달라지나

같은 후보를 한국어 문서와만 비교하도록 고치자, 이번에는 실제로 같은 업종을 다루는 한국어 페이지와 타당한 수준의 겹침 점수로 비교됐다. 겹침이 사라진 게 아니라, 비교 대상이 올바른 상대로 바뀐 것이다.

기준을 느슨하게 만든 것 아닌가

아니다. 기존에 이미 확정된 판정(예를 들어 특정 후보가 기존 요금 안내 페이지와 겹친다는 판정)은 그대로 유지됐다. 바뀐 것은 “누구와 비교할 것인가”이지 “얼마나 겹쳐야 겹친다고 볼 것인가”가 아니다.

이 문제가 왜 언어가 늘어날수록 심해지는가

지금은 한국어와 영어 두 언어뿐이라 대조 대상의 절반 가까이가 영어였다. 앞으로 다루는 언어가 더 늘어난다면, 언어를 구분하지 않는 대조 로직은 오판 빈도가 그만큼 더 늘어난다. 새 언어를 추가하기 전에 이 구분을 먼저 만들어 둔 것이 맞는 순서였다.