본문으로 건너뛰기
유환호 연락하기

홈 / 기록

월간 리포트에 넣지 않기로 한 지표 네 가지

한눈에 답변

월간 데이터 리포트를 만들 때, 계산할 수 있는데도 일부러 넣지 않은 지표가 네 가지 있었다. 전월 대비 증감은 시장 변화가 아니라 데이터 삭제 정책과 수집 범위 확장을 재는 수치였고, 일별 추이는 수집이 안 된 날들 때문에 왜곡됐으며, 금액 분포는 표본이 전체의 12%뿐이라 대표성이 없었고, 플랫폼별 경쟁률은 신청 현황 공개 정책이 플랫폼마다 달라 비교 자체가 성립하지 않았다.

리포트를 만들기 전에 무엇부터 확인했나

운영 데이터베이스는 마감 30일이 지난 공고를 지우는 구조라, 월간 리포트를 만들기 전에 그 달의 데이터가 아직 충분히 남아 있는지부터 확인해야 했다. 확인 결과 지난달 수집분 대부분이 아직 보관돼 있어 리포트 자체는 성립한다고 판단했다. 문제는 그 다음이었다 — 계산할 수 있는 모든 지표를 다 넣어도 되는가였다.

넣지 않은 첫 번째 — 전월 대비 증감

전달의 남은 데이터는 이번 달 수집분의 4분의 1 수준이었다. 겉으로 보면 시장이 몇 배로 커진 것처럼 보이지만, 실제로는 전달분이 삭제 정책에 따라 이미 많이 지워졌고, 게다가 전달은 수집 대상 플랫폼을 계속 늘려 가던 시기라 애초에 관측 범위 자체가 달랐다. 이 두 숫자를 비교하면 시장의 변화가 아니라 우리 쪽 수집 조건의 변화를 재게 된다.

넣지 않은 두 번째 — 일별 추이

한 달 안에 수집 기록 자체가 없는 날이 여러 날 있었고, 공고가 수집이 이루어진 날에 몰려서 찍히는 구조였다. 이 상태로 일별 그래프를 그리면 실제 등록일 분포가 아니라 우리의 수집 스케줄을 보여주는 그래프가 된다.

넣지 않은 세 번째와 네 번째 — 금액 분포와 플랫폼별 경쟁률

제공 금액 정보가 있는 공고는 전체의 12%뿐이었다. 이 정도 비율로는 전체를 대표한다고 말할 수 없었다. 플랫폼별 경쟁률은 이전에 이미 겪은 문제와 같은 종류였다 — 신청 현황을 공개하는 정책이 플랫폼마다 달라서, 공개 안 하는 곳이 낮은 경쟁률로 계산되는 왜곡이 그대로 재발할 수 있었다.

대신 무엇을 주 지표로 썼나

경쟁률은 평균이 아니라 중앙값을 주 지표로 썼다. 평균과 중앙값 사이에 큰 격차가 있었는데, 이는 극단적으로 경쟁이 치열한 소수의 공고가 평균을 크게 끌어올리기 때문이었다. 평균도 함께 표기하되, 왜 중앙값을 대표값으로 선택했는지 화면에 그 이유를 그대로 적었다. 넣지 않은 네 가지도 전부 본문에 이유와 함께 밝혔다 — 안 만든 지표와 못 만든 지표는 다르고, 독자가 그 차이를 알아야 리포트를 신뢰할 수 있기 때문이다.