VISIOGROWTH
메뉴 +

홈페이지·SEO

robots.txt, 홈페이지 수집 차단 여부 확인하는 순서

비지오그로스작성

홈페이지를 공개했는데 검색에 안 보일 때 robots.txt로 수집이 막혔는지 확인하는 방법을 정리합니다. 파일 위치, 확인 절차, noindex·로그인 접근 통제와의 차이, 제작업체에 전달할 준비물까지 다룹니다.

홈페이지가 공개되었는데 검색 결과에 보이지 않는다면, 가장 먼저 그 도메인의 robots.txt 파일에서 수집 차단 규칙을 확인합니다. robots.txt는 검색엔진 크롤러의 접근 범위를 정하는 파일이며, 수집을 막아도 다른 사이트의 링크를 통해 주소만 검색에 나타날 수 있습니다. 검색 결과에서 완전히 빼려면(Google 기준) noindex 설정이 따로 필요하고, 내용 자체를 외부에 노출되지 않게 막으려면 로그인 같은 접근 통제가 필요합니다.

robots.txt는 정확히 무엇을 하는 파일인가요?

robots.txt는 검색엔진 크롤러가 사이트의 어떤 주소에 접근해도 되는지를 정하는 텍스트 파일입니다. 구글은 이 파일의 목적을 크롤러 요청으로 사이트 서버에 과도한 부담이 가는 것을 피하기 위한 장치로 설명하며, "웹페이지를 구글에서 빼는 수단이 아니다"라고 분명히 구분합니다(robots.txt 소개). robots.txt에서 어떤 경로를 막아도, 그 주소가 다른 사이트의 링크로 알려져 있다면 주소만 검색 결과에 나타날 수 있습니다. 수집 차단과 검색 노출 차단은 서로 다른 장치이며, 이 둘을 구분하는 것이 이 글 전체의 전제입니다. 검색 노출 외에 챗GPT·퍼플렉시티 같은 AI 검색에서의 인용 조건은 별도 주제이며, AEO 세팅이란 무엇인가에서 다룹니다.

공개한 홈페이지의 robots.txt는 어디서, 어떻게 확인하나요?

robots.txt는 그 도메인의 루트 주소에 정해진 파일명으로만 존재합니다. 구글은 파일명이 정확히 robots.txt여야 하고 적용 대상 사이트 호스트의 루트에 위치해야 한다고 안내하며, 하나의 프로토콜·호스트·포트 조합마다 robots.txt가 하나씩만 유효하다고 설명합니다(robots.txt 만들기). 확인 절차는 다음 순서로 진행합니다.

  1. 브라우저 시크릿 창에서 `https://도메인/robots.txt`를 직접 열어 내용이 뜨는지 봅니다(여기서 도메인은 예시이며, 실제 운영 도메인으로 바꿔 확인합니다).
  2. 구글 서치콘솔에 등록된 사이트라면 robots.txt 리포트에서 구글이 실제로 읽은 내용을 확인합니다.
  3. 네이버는 robots.txt 파일이 아예 없을 때는 수집을 허용하는 것으로 간주한다고 서치어드바이저 가이드에 안내되어 있습니다(네이버 서치어드바이저 robots.txt 가이드). 그래서 파일이 없는 경우와 파일은 있는데 차단 규칙이 들어 있는 경우를 구분해서 봐야 합니다.

robots.txt에 차단 규칙이 있다면 어떻게 확인하고 요청해야 하나요?

차단 규칙을 발견했다면 다음 순서로 대조합니다.

  1. 적용 그룹 확인: `User-agent: *`는 구글의 AdsBot 계열 크롤러를 제외한 나머지 크롤러에 적용되는 규칙이며, AdsBot은 이름을 따로 지정해야 적용됩니다(robots.txt 만들기). 같은 문서는 이름이 지정된 더 구체적인 크롤러 그룹이 있으면 그 그룹의 규칙이 와일드카드보다 먼저 매칭된다고 설명합니다. 이는 구글 문서가 설명하는 매칭 방식이며, 네이버가 Yeti 같은 자체 크롤러에도 같은 방식으로 그룹을 우선 매칭하는지는 네이버 공식 문서로 확인하지 못했습니다.
  2. 경로 대조: 1번에서 확인한 그룹 아래 `Disallow`·`Allow` 줄에서, 확인하려는 페이지의 실제 경로가 걸리는지 봅니다. 예를 들어 `Disallow: /admin/`은 `/admin/` 하위 경로만 막는 예시이며, `Disallow: /` 한 줄만 있다고 해서 모든 크롤러가 전체 사이트에서 막혀 있다고 단정하지 않습니다(그 줄이 1번에서 확인한 그룹에 속하는지가 먼저입니다). 같은 그룹 안에서 여러 규칙이 함께 걸리면 구글은 경로가 더 긴(더 구체적인) 규칙을 적용하고, 길이가 같아 충돌하면 덜 제한적인 `Allow`를 우선합니다(robots.txt 사양 해석).
  3. 도구로 재확인: 서치콘솔의 robots.txt 리포트는 파일 자체가 정상으로 읽히는지만 보여주므로, 특정 페이지의 수집 가능 여부는 구글 서치콘솔의 URL 검사에서 그 페이지의 '크롤링 허용' 여부를 직접 확인하고, 규칙을 고친 뒤에는 URL 검사의 실제 URL 테스트로 다시 점검합니다(URL 검사 도구). 네이버는 서치어드바이저가 안내하는 로봇 규칙 테스트 기능으로 그 페이지의 수집 가능 여부를 확인할 수 있습니다(네이버 서치어드바이저 robots.txt 가이드).

이 대조로도 차단 규칙이 확인되면, 제작업체나 개발 담당자에게 요청할 때 아래 세 가지를 함께 전달합니다.

  1. 실제 주소로 열어 본 robots.txt 전체 내용 캡처.
  2. 막혀 있길 원하지 않는 페이지 주소 목록.
  3. 검색 노출을 원하는 시점(공개 즉시인지, 콘텐츠 보완 이후인지).

소스 코드에서 고친 파일과 실제 배포된 응답이 다를 수 있다는 점도 주의합니다. 수정을 요청한 뒤에는 반드시 실제 주소로 다시 열어 반영 여부를 확인합니다.

robots.txt·noindex·로그인 접근 통제는 어떻게 다른가요?

robots.txt는 크롤러의 수집(읽기) 접근만 막고, noindex는 지원하는 검색엔진에서 검색 결과 등재 자체를 막고, 로그인 같은 접근 통제는 사람과 크롤러 모두의 접근을 막습니다. 막는 대상이 다르므로 검색 노출에 미치는 효과도 다릅니다.

구분막는 것검색 노출에 미치는 영향제한
robots.txt크롤러의 수집(읽기) 접근막아도 외부 링크로 주소가 노출될 수 있음구글은 robots.txt 안의 noindex 규칙을 지원하지 않음
noindex(meta 태그·헤더)검색 결과 등재 자체정상 작동하면 검색 결과에서 빠짐크롤러가 그 페이지에 접근할 수 있어야 읽힘
로그인 등 접근 통제사람·크롤러 모두의 접근인증하지 않은 방문자의 보호된 본문 접근을 제한함공개할 페이지에는 쓸 수 없음

구글은 noindex가 작동하려면 그 페이지나 리소스가 robots.txt로 막혀 있지 않아야 하고, 지원하는 크롤러가 그 페이지에 실제로 접근해 다시 수집하고 태그나 헤더를 읽어야 반영된다고 설명합니다(색인 생성 차단 안내). 이는 구글 기준이며, 같은 문서는 검색엔진마다 noindex 규칙을 다르게 해석할 수 있다고도 밝히고 있어 이 동작을 다른 검색엔진에 그대로 적용하지 않습니다. robots.txt로 막아 놓은 채 noindex 태그만 추가하면 크롤러가 그 태그를 읽지 못해 효과가 없습니다. 민감한 정보를 다루는 관리자 페이지라면 robots.txt가 아니라 로그인 같은 접근 통제로 보호하는 쪽이 맞습니다.

수집이 열려 있는데도 검색에 안 보이면 다음에 무엇을 확인하나요?

robots.txt에 차단 규칙이 없더라도 검색에 안 보일 수 있으며, 이때는 서버·방화벽·인증 설정에서 실제 접근 자체가 막혀 있지 않은지부터 확인합니다. 그다음 공개 도메인과 실제 운영 도메인이 같은지, 페이지에 noindex 태그가 남아 있지 않은지, 사이트맵에 그 주소가 포함돼 있는지를 순서대로 봅니다.

전문직 홈페이지, 만들기 전에 정할 7가지, 만들고 검색 안 되는 이유에서 다룬 도메인·색인 구조 점검과 이어지는 단계입니다. 사무소를 이전하거나 도메인을 바꾼 뒤라면 사무소 이전 때 검색 자산을 지키는 체크리스트에서 주소 변경에 따른 재확인 항목을 함께 봅니다.

자주 묻는 질문

robots.txt가 없으면 검색에 전혀 안 나오나요? 아닙니다. robots.txt 파일이 없을 때 네이버는 수집을 허용하는 것으로 간주합니다. 구글도 이 파일이 없다고 수집을 막는 것은 아니며, 오히려 차단 규칙이 들어 있을 때 수집이 제한됩니다.

robots.txt에서 허용했는데도 검색에 안 보이면 뭘 봐야 하나요? 서버·방화벽·인증 설정에서 실제 접근 자체가 막혀 있지 않은지 먼저 봅니다. 그다음 페이지에 noindex 태그나 헤더가 남아 있는지, 사이트맵에 그 주소가 포함돼 있는지, 공개 도메인이 실제 운영 도메인과 같은지를 차례로 확인합니다.

관리자 페이지도 robots.txt로 막아 두면 안전한가요? robots.txt는 크롤러의 수집만 제한하는 장치이며 사람의 접근을 막지 못합니다. 민감한 정보를 다루는 관리자 페이지는 로그인 같은 접근 통제로 보호하는 것이 맞습니다.

관련 안내

robots.txt 확인은 홈페이지 제작 과정에서 제작사와 함께 짚어야 할 항목이며, 공개 이후 꾸준히 검색에 노출되도록 다듬는 작업은 검색 콘텐츠에서 이어서 다룹니다. 전체 마케팅 구조까지 점검하려면 병의원 마케팅 안내를 함께 확인하시기 바랍니다.

내 전문 분야 브랜딩 상담

정리되지 않은 고민도 괜찮습니다.
지금 필요한 도움을 편하게 적어주세요.

작성한 내용은 상담 접수와 답변을 위해 처리합니다.
개인정보처리방침 보기