크롤링 예산은 소규모 사이트에는 없는 문제입니다
크롤링 예산 최적화는 페이지 수백만 개 사이트의 문제입니다. 페이지 수백 개 사이트가 이 걱정에 시간을 쓰면 정작 필요한 일이 밀립니다.
SEO 자료를 읽다 보면 크롤링 예산이라는 말을 자주 만납니다. 구글이 사이트마다 방문 횟수를 배정하니 그걸 아껴 써야 한다는 이야기. 맞는 이야기입니다. 다만 누구의 문제인지가 늘 빠져 있습니다.
구글이 밝힌 크롤링 예산 관리 문서의 기준으로, 크롤링 예산은 페이지가 백만 단위이거나 매일 수만 페이지가 갱신되는 사이트의 관심사입니다. 페이지 수백 개짜리 회사 사이트나 블로그는 구글이 배정하는 방문량 안에서 전부 넉넉히 소화됩니다. 우리 글이 색인 안 되는 이유가 "예산이 모자라서"인 경우는 사실상 없습니다.
내 사이트가 어느 쪽인지는 두 숫자를 나란히 놓으면 갈립니다. 사이트맵에 들어 있는 주소 수, 그리고 서치콘솔 크롤링 통계 보고서에 잡히는 하루 요청 수. 앞엣것이 수백인데 뒤엣것이 그에 못지않게 나오고 있다면, 구글은 이미 사이트를 통째로 훑고도 여력이 남는 상태입니다. 이 상태에서 예산을 아껴 봐야 아낀 몫을 쓸 곳이 없습니다. 같은 보고서에서 응답 코드별 비율과 평균 응답 시간도 함께 읽어 두면, 요청이 뜸한 이유가 배정 탓인지 서버 탓인지 그 자리에서 갈립니다. 대개는 뒤쪽입니다.
예산이 실제로 걸리는 사이트에는 공통점이 하나 있습니다. 페이지가 많은 게 아니라 주소가 스스로 불어난다는 것. 색상과 사이즈 조합마다 주소가 따로 생기는 쇼핑몰의 옵션 주소, 필터를 누를 때마다 새로 만들어지는 검색 결과 화면, 끝이 나오지 않는 달력 페이지가 그렇습니다. 이때도 처방은 배정을 늘리는 쪽이 아니라 불어나는 주소를 잠그는 쪽입니다.
그런데 이 걱정이 실무를 자주 오염시킵니다. 태그 페이지를 막아야 하나, 페이지네이션이 예산을 축내나 같은 고민에 시간을 쓰는 동안, 색인이 안 되는 진짜 사유는 다른 곳에 그대로 있습니다. 품질 미달, 중복 판정, 링크 못 받은 고아 글. 전부 예산이 아니라 신뢰의 문제입니다.
예산 걱정 대신 볼 실제 문제는 얇은 태그 페이지가 쌓이는 것 같은 품질 쪽입니다. 그 밖에 작은 사이트가 크롤링과 관련해 챙길 일은 둘로 줄어듭니다. 서버가 자주 죽지 않는 것, 그리고 새 글로 가는 내부 링크를 빨리 놓는 것. 이 둘은 예산 최적화가 아니라 기본 위생이고요.
헷갈릴 때 갈라 주는 질문은 하나입니다. 로봇이 오기는 오는데 색인이 안 되는가, 아니면 오는 것 자체가 뜸한가. 앞이라면 판정의 문제라서 볼 곳은 내용과 중복입니다. 뒤라면 서버 응답 시간과 그 페이지로 들어가는 링크를 봅니다. 두 갈래를 가르는 데는 서치콘솔에서 해당 주소를 한 번 검사해 보는 것으로 충분합니다. 어느 쪽이든 처방이 예산 최적화로 이어지지 않습니다.
다만 크롤링 예산이라는 개념 자체가 허구라는 뜻은 아닙니다. 문서에 적힌 대로 실재하는 제약이고, 주소가 수십만 개를 넘어가는 사이트에서는 우선순위 맨 앞에 놓입니다. 문제는 그 제약을 자기 체급의 문제로 옮겨 놓을 때 생깁니다. 남의 병에 쓰는 약을 먼저 삼키면, 정작 앓고 있는 자리는 그대로 남습니다.
몸무게 50킬로인 사람이 스모 선수의 감량법을 연구할 필요는 없습니다. 체급에 맞는 문제 목록을 갖는 것도 실력입니다.
사장님들께 가장 자주 받는 질문부터 다룹니다. 답이 갈리는 자리는 추측으로 넘기지 않고, 직접 확인한 만큼만 적습니다.