링크가 복사되었습니다.

robots.txt에 대한 완벽 가이드북

robots.txt에 대한 완벽 가이드북

robots.txt는 웹사이트의 검색 엔진 최적화를 위한 기본입니다.

robots.txt가 어떻게 설정이 되었는지에 따라 사용자들이 볼 수 있는 사이트의 상태가 변경하기 때문에 잘 설정하는 것이 중요합니다.

이번 시간에는 robots.txt이 무엇이고 어떻게 설정해야 하는지 알아보도록 하겠습니다.

robots.txt란?

robots.txt는 검색 엔진 로봇에게 웹사이트를 어떻게 크롤링 해야 하는지 가이드를 해주는 역할을 합니다. 또한 크롤러에게 URL의 어느 부분에 액세스 가능한지 아닌지의 여부를 알려주며 웹사이트의 사이트맵을 가이드 하는 역할을 합니다.

robots.txt는 항상 사이트의 루트 폴더 또는 메인 디렉터리에 위치해야 하며 대부분 텍스트 파일로 설정이 되어 있습니다.

robots.txt의 영향

웹페이지

웹페이지에 robots.txt를 사용하게 되면 검색 크롤러에 의한 페이지의 과부화를 방지할 수 있습니다. 사이트에 중요하지 않은 페이지 또는 중복이 되는 페이지가 있다면 굳이 크롤링이 필요하진 않겟죠?

robots.txt로 크롤링 트래픽을 관리하기 위해 이러한 페이지의 크롤링을 방지하는 것입니다. 하지만 여기서 명심해야 할 것은 이 파일을 이용해 웹페이지를 검색 결과에서 숨기면 안된다는 것입니다.

미디어 파일

robots.txt 파일로 이미지, 동영상과 같은 미디어 파일이 검색 결과에 노출되지 않게 할 수 있습니다. 사용자가 이미지, 동영상 파일에 연결하는 것은 막을 수 없으니 참고 바랍니다.

리소스 파일

페이지에 큰 영향을 주지 않는 요소가 있을 경우 robots.txt 파일로 이러한 리소스를 차단할 수 있습니다. 그러나 페이지에 중요한 영향을 끼치는 리소스는 이 파일을 사용해 차단하게 된다면 검색 크롤러가 페이지를 이해할 수 없기 때문에 그것을 주의해야 합니다.

제한 사항 이해하기

robots.txt도 제한 사항 몇 가지가 있습니다.

robots.txt가 페이지 모든 범위를 차단할 수 없기 때문에 다른 차단 방법을 알아보는 것도 중요합니다. 또한 설정할 때의 상황과 목표에 따라 설정하는 것이 중요하기 때문입니다.

일부 검색 엔진에서만 지원 가능

모든 크롤러가 같은 지침을 따르지 않습니다. 다시 말해, 각 크롤러마다 준수할 지침이 다르다는 것입니다.

각 크롤러만의 다른 해석

구글 색인

단순히 robots.txt 만으로 액세스를 허용하지 않게 페이지 설정을 해도 다른 사이트에서 연결이 된다면 구글에서 색인이 됩니다.

URL 주소를 포함한 페이지의 앵커 텍스트와 기타 정보가 구글 검색 결과에 노출될 수 있는 위험이 있습니다. URL이 구글 검색 결과에 나타나지 않게 하려면 noindex 메타 태그를 사용하거나 서버에 비밀번호를 걸어 놓는 것이 좋습니다.

robots.txt 지시어 및 규칙

여러 가지 용도로 robots.txt를 설정하기 위해선 어떤 용어와 규칙이 있는지 알아야 합니다. 쓰이는 용어를 이해를 한 뒤, 규칙을 설정하고 싶다면 도메인 주소에 /robots.txt를 입력하고 설정할 수 있습니다.

robots.txt 지시어

user-agent규칙이 적용되는 크롤러
disallow유저 에이전트의 디렉터리 또는 페이지 크롤링을 차단
allow유저 에이전트의 디렉터리 도는 페이지 크롤링을 허용 (구글봇에만 적용 가능)
sitemap웹사이트의 모든 리소스를 나열한 목록 파일

크롤링 봇으로는 Googlebot(구글), Yeti(네이버), Bingbot(빙), Slurp(야후) 등이 있습니다.

robots.txt 규칙

www.예시.com/robots.txt를 예시로 몇 가지의 규칙에 대해 알아보도록 하겠습니다.

크롤링 차단하기

사이트의 모든 콘텐츠를 크롤러로부터 차단하고 싶다면 아래와 같이 설정하면 됩니다.

앞서 설명했듯이 user-agent는 크롤링 봇을 말하며 *표시가 된 것은 모든 크롤링 봇을 말합니다.

Disallow는 페이지를 크롤링 하지 않게 하는 설정인데요. / 표시를 하면 크롤링 차단을 할 수 있습니다. 해석을 하면 모든 크롤링 봇으로부터 www.예시.com 홈페이지를 포함한 모든 페이지의 크롤링을 차단한다는 뜻입니다.

크롤링 허용하기

반대로 모든 크롤링 봇의 액세스를 허락하는 설정도 있습니다.

이렇게 disallow에 / 표시가 없으면 크롤링을 허락한다는 것을 나타냅니다.

다시 말해 모든 크롤링 봇이 www.예시.com 홈페이지를 포함한 모든 페이지의 크롤링을 허용한다는 뜻입니다.

특정 크롤러 차단하기 – 특정 폴더

특정 폴더를 크롤러로부터 차단하고 싶다면 아래와 같이 설정할 수 있습니다.

Googlebot은 구글의 크롤링 봇의 이름입니다. 이 봇을 차단하고 싶다면 user-agent에 해당 봇의 이름을 입력하면 됩니다.

만약에 특정 위치에만 크롤링 봇을 차단하고 싶다면 위치를 선정할 수 있습니다.

이렇게 되면 www.예시.com/example-subfolder/의 URL이 포함된 페이지의 크롤링을 차단할 수 있습니다.

동시에 여러 개의 디렉터리의 콘텐츠 크롤링 차단도 가능합니다.

위 파일 같은 경우는 크롤러가 캘린더와 정크 디렉터리를 액세스할 수 없습니다.

특정 크롤러 차단하기 – 특정 웹페이지

크롤러가 특정 웹페이지를 액세스 못하게 차단할 수 있습니다.

이렇게 설정하면 네이버의 크롤러 Yeti가 www.예시.com/example-subfolder/blocked-page.html의 특정 페이지를 크롤링 하지 못하게 차단할 수 있습니다.

하나를 제외한 모든 크롤러 허용/차단하기

위에 소개된 설정을 동시에 설정할 수 있습니다.

이렇게 될 경우 Unnecessarybot만 차단이 되며 나머지 크롤러는 사이트에 액세스를 할 수 있습니다.

반대로 하나의 크롤러만 허용하고 싶다면 아래와 같이 설정하면 됩니다.

이렇게 설정하면 Googlebot-news만 허용이 되면 나머지 크롤러는 액세스가 차단됩니다.

이미지 크롤링 차단

구글 이미지에서 특정 이미지의 크롤링을 차단하고 싶다면 구글 이미지 크롤러가 접근하지 못하게 설정해야 합니다.

이미지를 크롤링 하는 Googlebot-Image 봇은 이러한 상황에서 강아지와 관련된 이미지를 크롤링 하지 못하게 됩니다.

모든 이미지의 액세스를 차단하고 싶다면 단순히 disallow에 /만 하면 크롤러가 이미지에 접근하지 못합니다.

특정 문자열로 끝나는 URL 크롤링 차단

특정 문자열로 끝나는 URL을 차단하고 싶다면 $ 표시를 사용해야 합니다.

.xls는 엑셀 링크를 뜻하고 .gif는 GIF 파일을 뜻하는 문자열입니다. 크롤러의 해당 URL 액세스를 차단하고 싶다면 뒤에 $로 표기해야 합니다.

robots.txt 설정하기

간혹 페이지에 robots.txt가 설정이 되어 있는지 모르는 경우가 있습니다.

이럴 때는 루트 도메인에 /robots.txt 마지막에 입력한 후 검색을 해보면 나옵니다. 결과로 no.txt가 뜬다면 robots.txt가 설정이 되어 있지 않은 상태입니다.

robots.txt를 설정하기 앞서 이 파일은 HTML 파일이 아닌 일반 텍스트 파일로 작성해야 하고 루트 디렉터리에 위치해야 합니다.

robots.txt를 만들기 위해서는 아래의 특징을 명심해야 합니다:

  • 파일 이름은 robot.txt로 지정해야 합니다.
  • 사이트 당 하나의 robot.txt 파일이 있어야 합니다.
  • 철자 오류가 있으면 안 됩니다: Robots.txt/robots.TXT는 인식이 안됩니다.

주의할 점

더욱더 효과적으로 robots.txt를 활용하기 위해 주의해야 할 점이 여러 개 있습니다:

  • 크롤링이 되길 원하는 사이트의 콘텐츠 또는 리소스가 차단되어 있지 않아야 합니다.
  • robots.txt로부터 차단된 사이트의 링크는 nofollow입니다. 따라서 사이트의 링크가 follow이길 원한다면 다른 차단 방법을 사용해야 합니다.
  • robots.txt가 포함된 사이트는 모든 사람들이 액세스를 할 수 있기에 절대로 개인정보를 파일에 추가하지 않아야 합니다. (숨기고 싶다면 noindex로 색인을 차단하거나 암호로 페이지를 보호하는 방법이 있다는 것을 알려드립니다.)
  • 구글 봇 그리고 구글 봇 이미지와 같이 여러 크롤러가 있는 경우에는 각 크롤러가 이해할 수 있도록 정확하게 robots.txt를 만들어야 합니다.

마무리

robots.txt에 대한 설명은 여기까지입니다. 궁금하신 것이 있다면 아래 댓글을 달아주세요 🙂


마케터를 위한 참고 자료

추천 아티클

네이버 AI 탭은 쇼핑·플레이스·지도 등 네이버 서비스와 연계해 실제 행동까지 이어주는 실행형 AI 검색입니다. PC와
네이버 AI 브리핑은 콘텐츠 품질보다 검색어 구조에 더 크게 좌우됩니다. 어떤 검색어가 안정적으로 노출되고 어떤

💡 [콘텐츠 30초 요약] 클로드(Claude)란?클로드는 미국 AI 기업 Anthropic이 만든 대화형 AI이자 대규모 언어 모델

구글 AI 모드는 이제 신기능이 아니라 검색의 새로운 기본값입니다. 제미나이와는 어떻게 다른지, '쿼리 팬아웃' 구조가
네이버가 AI 브리핑과 AI 탭으로 검색을 '실행'의 영역까지 확장하고 있습니다. 100억 달러 규모의 인프라 투자부터
검색 결과 1위에 올라도 예전만큼 클릭이 안 늘어난다면, AEO(답변 엔진 최적화)를 확인해볼 차례입니다. AI가 내

지금 구독하고,
SEO 무료 팁을 받아보세요

맞춤 SEO 전략이 궁금하시다면 지금 바로 클릭해보세요!