robots.txt AI 크롤러 허용 설정하는 법
- robots.txt에 User-agent와 Allow 규칙만 추가하면 AI 크롤러 허용이 가능합니다.
- GPTBot·Google-Extended·PerplexityBot 등 크롤러마다 목적과 성격이 다릅니다.
- 티스토리·워드프레스 등 플랫폼별로 수정 방법과 접근 경로가 다릅니다.
- 기본 템플릿의 전체 차단 설정이나 오타 때문에 노출이 막히는 경우가 흔합니다.
robots.txt AI 크롤러 허용, 핵심부터 바로 답하기

robots.txt는 검색엔진이나 AI 크롤러(웹사이트를 자동으로 방문해 콘텐츠를 수집하는 프로그램)에게 ‘어떤 페이지는 방문해도 되고, 어떤 페이지는 방문하면 안 되는지’ 알려주는 규칙 텍스트 파일입니다. AI 크롤러를 허용하려면 사이트 루트에 있는 robots.txt 파일에 User-agent(크롤러 식별 이름) 줄과 Allow: / 줄을 한 쌍으로 추가하면 됩니다. 반대로 차단하고 싶은 크롤러가 있다면 같은 자리에 Disallow: /를 넣으면 됩니다.
robots.txt에 특정 크롤러 이름이 아예 적혀 있지 않으면 원칙적으로는 허용된 것으로 해석되지만, 티스토리·워드프레스 등 일부 플랫폼 기본 템플릿에는 전체 차단(Disallow: /) 규칙이 깔려 있는 경우가 있어 반드시 직접 확인해야 합니다.
AI 크롤러란 무엇이고 왜 허용 여부를 결정해야 할까
학습용·실시간 답변용·검색 노출용 크롤러의 차이
AI 크롤러는 목적에 따라 크게 세 갈래로 나뉩니다. GPTBot·ClaudeBot·CCBot·Bytespider처럼 모델 학습 데이터를 수집하는 크롤러가 있고, ChatGPT-User·Claude-User처럼 사용자 질문에 답할 때 실시간으로 웹 페이지를 열어 인용하는 크롤러가 있습니다. 여기에 더해 OAI-SearchBot·Claude-SearchBot처럼 챗봇 내부 검색 결과 품질을 높이려고 별도로 콘텐츠를 색인하는 크롤러도 있어, AI 검색 노출(AEO·GEO)을 목표로 한다면 이 세 번째 유형을 놓치지 않는 것이 중요합니다. 세 유형을 구분해야 어떤 크롤러를 허용하고 어떤 크롤러를 차단할지 판단하기 쉬워집니다.
허용·차단이 AI 검색 노출에 미치는 영향
실시간 답변용 크롤러를 차단하면 챗GPT나 퍼플렉시티 같은 생성형 AI 검색 답변에 내 콘텐츠가 출처로 인용될 기회 자체가 사라집니다. 이는 최근 주목받는 AEO(답변 엔진 최적화)·GEO(생성형 엔진 최적화) 전략과도 직결되는 부분입니다. 반대로 학습용 크롤러를 허용하면 내 글이 AI 모델의 학습 데이터로 활용될 수 있다는 점에서, 콘텐츠 노출 확대와 무단 활용 우려 사이에서 선택이 필요합니다.
주요 AI 크롤러 User-agent 정리

robots.txt에 이름을 적어 넣을 때 실수하기 쉬운 부분이 정확한 User-agent 표기입니다. 대소문자와 철자를 정확히 맞춰야 크롤러가 규칙을 제대로 인식합니다. 특히 Anthropic 공식 문서는 현재 ClaudeBot·Claude-User·Claude-SearchBot 세 개 크롤러만 공식 목록으로 안내하고 있어, 예전에 쓰이던 anthropic-ai라는 이름은 이 목록에 없습니다. robots.txt에 anthropic-ai를 그대로 적어 둬도 지금 발생하는 Claude 트래픽의 User-agent 문자열과는 일치하지 않아 규칙이 적용되지 않습니다.
| User-agent | 소속·서비스 | 주요 용도 |
|---|---|---|
| GPTBot | OpenAI(챗GPT) | 모델 학습용 데이터 수집 |
| ChatGPT-User | OpenAI | 챗GPT 답변 생성 시 실시간 방문 |
| OAI-SearchBot | OpenAI | 챗GPT 검색 기능 노출 전용 인덱싱 |
| Google-Extended | Google(제미나이·AI 개요) | 생성형 AI 학습·요약 인용 제어 |
| PerplexityBot | Perplexity | 실시간 검색 답변 생성 |
| ClaudeBot | Anthropic(클로드) | 모델 학습용 데이터 수집 |
| Claude-User | Anthropic(클로드) | 사용자 질문 응답을 위한 실시간 페이지 조회 |
| Claude-SearchBot | Anthropic(클로드) | Claude 내 검색 결과 품질 개선용 인덱싱 |
| CCBot | Common Crawl | 공개 웹 아카이브 수집(다수 AI 모델이 재활용) |
| Bytespider | ByteDance(틱톡) | 모델 학습용 데이터 수집 |
| Applebot-Extended | Apple(애플 인텔리전스) | 생성형 AI 학습 제어 |
- 학습용 크롤러: GPTBot, ClaudeBot, CCBot, Bytespider
- 실시간 답변·인용용 크롤러: ChatGPT-User, Claude-User, PerplexityBot
- AI 검색 노출용(인덱싱) 크롤러: OAI-SearchBot, Claude-SearchBot
robots.txt AI 크롤러 허용 설정 방법
1단계: 현재 robots.txt 상태 확인하기
브라우저 주소창에 ‘내 도메인 주소/robots.txt’를 직접 입력해 현재 파일이 어떻게 되어 있는지 먼저 확인합니다. 구글 서치 콘솔에도 robots.txt 상태를 확인할 수 있는 메뉴가 있으니 함께 점검하는 것이 좋습니다.
2단계: 허용할 크롤러별 규칙 작성하기
- 텍스트 편집기로 robots.txt 파일을 열거나 새로 만듭니다.
- 허용하려는 크롤러마다 User-agent 줄과 Allow: / 줄을 한 쌍으로 추가합니다.
- 특정 폴더만 막고 싶다면 Allow: / 대신 해당 경로만 Disallow로 지정합니다(예: 관리자 페이지).
- 사이트맵 주소를 함께 적어 크롤러가 전체 페이지 목록을 쉽게 찾도록 돕습니다.
실제 작성 예시는 다음과 같은 구조입니다.
- User-agent: GPTBot
- Allow: /
- User-agent: PerplexityBot
- Allow: /
- User-agent: CCBot
- Disallow: /
3단계: 파일 업로드 후 정상 반영 확인하기
robots.txt 파일은 반드시 사이트 루트 경로에 정확히 ‘robots.txt’라는 이름으로 위치해야 크롤러가 인식합니다. 하위 폴더나 다른 이름으로 저장하면 아무리 규칙을 잘 적어도 적용되지 않습니다.
저장 후에는 다시 브라우저로 파일을 열어 내용이 제대로 반영됐는지 확인하고, 구글 서치 콘솔에서 재크롤링을 요청하면 실제 반영 여부를 더 빠르게 확인할 수 있습니다. 크롤러마다 재방문 주기가 달라 완전히 반영되기까지는 어느 정도 시차가 있을 수 있습니다.
플랫폼별 robots.txt 수정 방법

티스토리에서 수정하기
티스토리는 블로그 관리 화면 안에 robots.txt를 직접 편집할 수 있는 메뉴를 제공합니다. 정확한 메뉴 위치는 업데이트에 따라 달라질 수 있으므로, 관리자 화면 검색창에 ‘robots’를 입력해 해당 설정 메뉴를 찾는 것이 가장 확실합니다.
워드프레스·자체 서버에서 수정하기
워드프레스는 Yoast SEO, Rank Math 같은 SEO 플러그인의 파일 편집 기능을 통해 robots.txt를 수정할 수 있고, 서버에 직접 접근할 수 있다면 루트 폴더에 robots.txt 파일을 업로드하는 방식도 가능합니다. 네이버 블로그처럼 폐쇄형 구조인 플랫폼은 이용자가 robots.txt를 개별적으로 수정할 수 없는 경우가 많다는 점도 참고할 부분입니다.
설정 시 흔한 실수와 주의사항
- 기본 템플릿에 걸려 있는 전체 차단(Disallow: /) 규칙을 그대로 둬서 AI 크롤러뿐 아니라 검색엔진 노출까지 막히는 경우
- User-agent 이름의 대소문자·철자 오타로 규칙이 적용되지 않는 경우
- 특정 크롤러만 차단하려다 전체 크롤러 규칙(User-agent: *) 아래에 잘못 넣어 모든 크롤러에 영향을 주는 경우
- robots.txt 하나로 완전한 통제가 된다고 오해하는 경우
또한 콘텐츠 무단 활용이나 저작권 문제를 우려해 AI 크롤러를 차단하는 선택도 늘고 있습니다.
자주 묻는 질문
Q. robots.txt에서 AI 크롤러를 허용하면 검색 순위가 올라가나요?
robots.txt 허용 자체가 검색 순위를 직접 올려주는 요소는 아닙니다. 다만 크롤러의 접근이 막혀 있으면 애초에 콘텐츠를 읽거나 인용할 기회조차 사라지므로, 노출을 위한 최소 조건에 가깝다고 보면 됩니다.
Q. GPTBot만 차단하고 다른 크롤러는 허용하려면 어떻게 하나요?
User-agent별로 규칙 그룹을 나눠서 작성하면 됩니다. GPTBot 그룹에는 Disallow: /를, 나머지 허용하려는 크롤러 그룹에는 Allow: /를 각각 지정하면 크롤러마다 다른 규칙을 적용할 수 있습니다.
Q. robots.txt 설정을 바꾸면 바로 반영되나요?
파일 자체는 저장 즉시 브라우저로 열람할 수 있지만, 각 크롤러가 실제로 새 규칙을 반영하려면 크롤러가 다시 방문할 때까지 어느 정도 시차가 있을 수 있습니다. 구글 서치 콘솔에서 재크롤링을 요청하면 확인 속도를 조금 앞당길 수 있습니다.
Q. AI 크롤러를 전부 차단하면 어떤 단점이 있나요?
챗GPT, 퍼플렉시티 등 생성형 AI 답변에 내 콘텐츠가 출처로 인용되거나 요약 노출될 기회가 사라집니다. 반대로 콘텐츠 무단 활용을 우려한다면 의도적으로 차단하는 것도 하나의 전략적 선택이 될 수 있습니다.
Q. 이미 robots.txt로 차단했는데 예전에 수집된 데이터도 삭제되나요?
robots.txt는 앞으로의 크롤링만 통제할 뿐, 과거에 이미 수집되어 학습에 사용된 데이터를 소급해서 삭제하는 기능은 아닙니다. 기존 데이터 삭제를 원한다면 해당 AI 기업이 별도로 제공하는 옵트아웃이나 삭제 요청 절차를 확인해야 합니다.
