robots.txt는 검색로봇이 어떤 경로를 크롤링해도 되는지 안내하는 파일입니다. 검색 결과에서 페이지를 완전히 없애는 도구와는 역할이 다릅니다. 중요한 페이지를 실수로 Disallow하면 검색엔진이 내용을 읽지 못해 색인과 업데이트에 문제가 생길 수 있습니다.
Disallow는 크롤링 제한
robots.txt에서 경로를 막으면 로봇이 그 페이지 내용을 수집하지 않도록 요청하는 것입니다. 이미 알려진 URL이 검색결과에서 반드시 사라진다는 뜻은 아니므로 크롤링과 색인을 구분해야 합니다.
- 크롤링과 색인 구분
- 공개 페이지 실수 차단 주의
- 관리 경로만 선택 제한
- 검색엔진별 문법 확인
CSS·JS까지 무작정 막지 않습니다
검색엔진이 페이지를 정상적으로 렌더링하려면 스타일과 스크립트를 읽어야 할 수 있습니다. 보안을 목적으로 정적 자산을 차단하는 것은 효과가 없고 페이지 이해를 방해할 수 있습니다.
- 공개 CSS 허용
- 공개 JS 허용
- 이미지 수집 정책 확인
- 민감한 파일은 웹 접근 자체 차단
사이트맵 주소를 명확히 적습니다
robots.txt 하단에 Sitemap 지시문으로 XML 사이트맵의 전체 URL을 적으면 검색로봇이 사이트맵 위치를 발견하는 데 도움이 됩니다. 여러 사이트맵이 있다면 각각 선언할 수 있습니다.
- 절대 URL 사용
- HTTPS 주소
- 실제 200 응답 확인
- 사이트맵 변경 시 함께 확인
배포 전 테스트 차단을 반드시 제거
개발 중 전체 사이트를 Disallow하거나 noindex로 막았다가 공개 시 해제하지 않는 실수가 흔합니다. 오픈 체크리스트에 robots.txt와 meta robots 검사를 반드시 포함하는 것이 좋습니다.
- User-agent 확인
- Disallow: / 여부
- meta noindex 잔존 여부
- URL 검사
업탑미디어 편집 기준
이 글은 특정 상품 구매를 유도하기보다 홈페이지 제작과 운영 과정에서 실제로 확인할 항목을 정리한 정보성 가이드입니다. 서비스·법령·검색엔진 정책은 변경될 수 있으므로 중요한 결정 전에는 해당 서비스의 최신 공식 안내를 함께 확인하세요.
