기억으로 설명한 크롤러 동작 방식이 공식 문서와 달랐다
한눈에 답변
디자인 접근성 점검을 하던 중, 크롤러 동작 방식을 설명한 기존 글의 여러 문장이 공식 1차 문서와 어긋나 있다는 것을 함께 발견했다. 학습용 크롤러와 실시간 답변용 크롤러를 하나로 묶어 설명한 문장, 검증되지 않은 인과관계를 사실처럼 적은 문장, 실제로는 반례가 있는 예시가 섞여 있었다. 기억이 아니라 각 회사의 공식 문서를 하나씩 다시 확인해 문장을 교체했다.
어쩌다 발견하게 됐나
원래는 화면 명암 대비 같은 접근성 문제를 점검하던 작업이었다. 그런데 점검 대상 페이지의 문장을 다시 읽다가, 크롤러 동작 방식을 설명한 부분이 실제 공식 문서와 다르다는 것을 알아챘다.
구체적으로 어떤 문장이 틀렸나
학습 데이터를 모으는 용도의 크롤러와, 실시간 질문에 답하기 위해 검색하는 용도의 크롤러를 하나로 뭉뚱그려 “AI가 상대하는 크롤러”라고 설명한 문장이 있었다. 실제로는 이 둘이 서로 다른 크롤러이고, 각각 따로 접근을 허용하거나 차단할 수 있다.
또 다른 글에는 특정 챗봇의 웹검색 기능이 반드시 한 검색엔진의 색인을 거쳐야 한다는 취지의 문장이 있었는데, 그 회사의 공식 문서 어디에도 그런 단정은 없었다. 오히려 그 회사가 안내하는 노출 조건은 자사 전용 검색 크롤러의 접근 허용 여부였고, 다른 검색엔진은 여러 정보 제공자 중 하나로만 언급돼 있었다.
같은 글에 학습용 크롤러를 차단하는 예시 코드를 쓰고 “이 한 줄이면 그 챗봇이 사이트를 아예 안 읽는다”고 설명한 부분도 있었는데, 공식 문서가 정확히 이 상황을 반례로 들고 있었다.
어떻게 바로잡았나
기억이나 짐작으로 고치지 않고, 각 회사의 공식 문서를 새로 하나씩 찾아 원문을 확인한 뒤에만 문장을 바꿨다. 세 개 글의 관련 부분을 전면 교체했고, 서로 다른 두 제품을 한 문장에 묶어 설명하지 않도록 문장을 나눴다.
이 사이트가 파는 것과 무슨 관계가 있나
이 사이트가 파는 것 자체가 정확한 정보를 근거로 AI가 인용하게 만드는 일이다. 그런 사이트의 설명 글에 사실 오류가 있으면 신뢰 문제로 직결된다. 접근성 점검이라는 다른 목적으로 페이지를 다시 읽다가 이 문제를 함께 잡을 수 있었던 것은, 오히려 다른 이유로 전체를 다시 살펴보는 계기가 있었기 때문이다.