Sitemap 생성기
사이트를 크롤링하고 있습니다...
페이지 수에 따라 시간이 걸릴 수 있습니다.
0
페이지0
이미지0
오류0
KB| URL | 우선순위 |
|---|
사용 방법
Sitemap이란?
Sitemap은 웹사이트의 페이지 목록을 검색엔진에 알려주는 XML 파일입니다. Google, Bing, Naver 등의 검색엔진이 사이트를 더 효율적으로 크롤링할 수 있게 도와줍니다.
사용 방법
- 웹사이트 URL을 입력합니다.
- 옵션을 설정하고 생성 버튼을 클릭합니다.
- 생성된 sitemap.xml을 다운로드합니다.
- 웹사이트 루트 디렉토리에 업로드합니다.
- Google Search Console에 제출합니다.
Sitemap 생성기는 웹사이트 주소를 넣으면 그 사이트를 따라다니며 페이지를 모아 검색엔진에 제출할 sitemap.xml 을 만들어 주는 도구입니다. 시작 주소에서 링크를 타고 같은 도메인 안을 돌면서 정상 응답하는 페이지만 모으고, 결과를 XML 미리보기와 페이지 목록으로 보여 준 뒤 파일로 내려받게 합니다. 크롤링은 우리 서버가 대신 수행하므로 사이트에 무언가를 설치하거나 접속 정보를 넘길 필요는 없습니다.
사이트맵생성 사용 방법
- 웹사이트 URL 칸에 시작 주소를 넣습니다. https:// 를 빼고 적어도 자동으로 붙습니다.
- 최대 페이지 수를 고릅니다. 50·100·200·500·1000개 중에서 고를 수 있고 처음 값은 100개입니다.
- 변경 빈도와 기본 우선순위를 정합니다. 이미지 포함을 켜면 각 페이지에서 찾은 이미지 주소도 함께 모읍니다.
- Sitemap 생성을 누르고 기다립니다. 크롤링하는 동안 입력 폼이 잠기고 진행 표시가 나옵니다.
- XML 미리보기와 발견된 페이지 목록으로 결과를 확인한 뒤, sitemap.xml 다운로드로 파일을 받아 사이트 최상위 폴더에 올리고 서치콘솔에 제출합니다.
지원 형식과 입력 조건
- 크롤링 범위
- 시작 주소와 같은 도메인만. 외부 링크는 따라가지 않습니다
- 최대 페이지 수
- 50 / 100 / 200 / 500 / 1000 (처음 값 100)
- 수집 대상
- HTML 페이지 중 정상(200)으로 응답한 것만
- 제외 대상
- 이미지·CSS·JS·PDF·압축·음악·영상 확장자로 끝나는 주소, mailto·tel·javascript 링크, 주소에 # 이 들어간 링크, 관리자 페이지
- 대기 시간
- 한 페이지당 최대 10초. 전체 작업은 300초를 넘기면 중단됩니다
- 미리보기 범위
- 페이지 목록 20개, 오류 목록 10개까지 (내려받는 XML 에는 전체가 들어갑니다)
- lastmod 값
- 크롤링한 날짜로 채웁니다 (페이지의 실제 수정일이 아닙니다)
- 내려받는 파일
- sitemap- 뒤에 생성 시각이 붙은 xml 파일
- 처리 위치
- 서버. 입력한 주소로 우리 서버가 직접 접속합니다
우선순위와 변경 빈도가 정해지는 방식
- 고른 값이 모든 주소에 그대로 들어가지는 않습니다. 먼저 주소의 모양을 보고 정해진 규칙을 적용한 뒤, 규칙에 걸리지 않는 주소에만 고른 값을 씁니다.
- 시작 주소와 사이트 최상위 주소는 언제나 우선순위 1.0 을 받습니다.
- 규칙에 걸리지 않는 주소는 고른 기본 우선순위에서 경로 깊이 한 단계마다 0.1 씩 낮춰 계산합니다. 아무리 깊어도 0.3 아래로는 내려가지 않고 1.0 을 넘지도 않습니다.
- 변경 빈도도 같은 구조입니다. 최상위 주소에는 weekly 가 들어가고 나머지 주소에 고른 값이 쓰입니다.
- lastmod 는 페이지를 실제로 언제 고쳤는지가 아니라 크롤링한 날짜로 채워집니다. 그래서 한 번에 만든 사이트맵은 모든 주소의 날짜가 같습니다. 실제 수정일이 중요한 사이트라면 내려받은 파일에서 직접 고쳐야 합니다.
크롤링에서 빠지는 페이지
- 링크로 이어지지 않은 페이지는 찾지 못합니다. 시작 주소에서 링크를 타고 갈 수 있는 곳만 모으므로, 어디에서도 연결되지 않은 페이지는 결과에 들어가지 않습니다.
- 자바스크립트로 그려지는 링크는 따라가지 못합니다. 서버가 내려 준 HTML 안에 있는 링크만 봅니다. 화면에서는 보이지만 클릭할 때 만들어지는 주소는 수집되지 않습니다.
- 주소 안에 # 이 들어간 링크는 통째로 건너뜁니다. 같은 페이지 안의 위치를 가리키는 링크를 걸러 내기 위한 처리인데, # 뒤에 내용이 붙은 별도 페이지도 함께 빠집니다.
- 로그인이 필요한 페이지, 10초 안에 응답하지 않는 페이지, 오류로 응답한 페이지는 XML 에 들어가지 않고 오류로 집계됩니다. 어떤 주소가 몇 번 응답으로 빠졌는지는 오류 목록에서 확인할 수 있습니다.
- 최대 페이지 수에 도달하면 거기서 멈춥니다. 발견된 페이지 수가 고른 값과 똑같다면 사이트에 페이지가 더 있을 가능성이 큽니다. 값을 올려 다시 돌려 보세요.
- 관리자 화면으로 보이는 주소는 목록에서 제외합니다.
이미지 포함 옵션의 현재 동작
- 이미지 포함을 켜면 각 페이지의 이미지 태그에서 주소를 모아 통계의 이미지 수에 표시하고, XML 아래쪽에 목록으로 덧붙입니다. 최대 1000개까지 적힙니다.
- 다만 이 목록은 주석으로 처리된 상태로 들어갑니다. 검색엔진은 주석을 읽지 않기 때문에 지금 형태로는 이미지 사이트맵으로 동작하지 않습니다.
- 그래서 이 옵션은 사이트에 어떤 이미지가 쓰이는지 목록으로 확인하는 용도로 보시는 편이 맞습니다. 실제로 이미지를 검색엔진에 제출하려면 내려받은 파일에서 주석 표시를 직접 벗겨 내야 합니다.
- 이미지 주소는 페이지에 적힌 이미지 태그를 기준으로 모읍니다. 배경 이미지처럼 스타일로 넣은 것은 잡히지 않습니다.
자주 묻는 질문
남의 사이트 주소를 넣어도 되나요?
접속이 되는 사이트라면 만들어지기는 합니다. 다만 sitemap.xml 은 사이트의 최상위 폴더에 올려 두어야 쓸모가 있으므로, 파일을 올릴 권한이 있는 자기 사이트에 쓰는 것이 맞습니다. 남의 사이트에 반복해 돌리면 그 사이트에 불필요한 부담을 주게 됩니다.
robots.txt 로 막아 둔 페이지는 알아서 빠지나요?
빠지지 않습니다. 이 크롤러는 robots.txt 를 읽지 않고 링크만 따라갑니다. 그래서 검색엔진에는 보이지 않기를 바라는 주소도 결과에 들어올 수 있습니다. 내려받은 파일을 열어 그런 주소가 있는지 확인하고 직접 지운 뒤 제출하세요.
페이지가 몇 개밖에 나오지 않습니다.
몇 가지 원인이 있습니다. 링크로 연결되지 않은 페이지, 자바스크립트로 만들어지는 링크, 주소에 # 이 들어간 링크는 수집되지 않습니다. 최대 페이지 수에 걸렸거나 응답이 느려 오류로 빠졌을 수도 있습니다. 결과의 오류 숫자와 오류 목록을 먼저 확인하고, 최대 페이지 수를 올려 다시 시도해 보세요.
얼마나 걸리나요?
사이트의 응답 속도에 달려 있습니다. 한 페이지에 최대 10초까지 기다리고, 전체 작업이 300초를 넘으면 중단됩니다. 그래서 1000개를 골라도 사이트가 느리면 끝까지 돌지 못할 수 있습니다. 큰 사이트라면 낮은 값부터 시작해 어느 정도 속도가 나오는지 보고 올리는 편이 좋습니다.
만든 파일을 어떻게 써야 하나요?
내려받은 파일의 이름을 sitemap.xml 로 바꿔 사이트의 최상위 폴더에 올립니다. 그러면 주소창에 사이트주소/sitemap.xml 로 열립니다. 그다음 구글 서치콘솔의 사이트맵 메뉴에서 이 주소를 제출하면 됩니다. 페이지가 늘거나 줄면 다시 만들어 덮어써야 최신 상태가 유지됩니다.