튜토리얼
AI 크롤러 완전 정리: GPTBot, ClaudeBot 그리고 robots.txt

GPTBot, ClaudeBot을 비롯한 AI 크롤러가 무엇을 수집하는지, robots.txt에서 이들을 어떻게 맞이하는지, 서버 로그에서 CDN 차단을 어떻게 찾아내는지 살펴봅니다.
AI 크롤러는 OpenAI, Anthropic 등 AI 기업이 운영하는 자동화 프로그램으로, 여러분 웹사이트의 공개된 콘텐츠를 가져갑니다. 이들의 방문 목적은 두 가지입니다. AI 모델의 학습 데이터를 수집하는 것, 그리고 사용자가 질문했을 때 실시간으로 페이지를 가져오는 것입니다. 이 가이드에서는 공식 문서에 정리된 크롤러 목록, 이들을 환영하는 robots.txt 작성법, 의도치 않은 차단을 찾아내는 방법, 그리고 서버 로그에서 방문을 확인하는 방법을 다룹니다.
주요 AI 크롤러: 누가 내 사이트를 방문하고 있는가
AI 크롤러가 가져간 웹 콘텐츠는 대규모 언어 모델의 학습 데이터에 포함되거나, AI 엔진이 질문에 답할 때 실시간으로 인용됩니다. 공식 문서에 기록된 주요 크롤러는 다음과 같습니다.
- GPTBot: OpenAI가 운영하며, 모델 학습을 위해 공개된 웹 콘텐츠를 수집합니다.
- ClaudeBot: Anthropic이 운영하며, Claude 계열 모델의 학습 데이터를 수집합니다.
- PerplexityBot: Perplexity가 운영하며, 자사 AI 검색엔진의 기반이 되는 색인을 구축합니다.
- Google-Extended: Google이 제공하는 robots.txt 제어 토큰으로, 크롤러가 아닙니다. 여러분의 콘텐츠를 AI 학습에 사용할 수 있는지를 결정하며, 실제 수집은 여전히 Googlebot이 담당합니다.
- CCBot: 웹의 공개 아카이브를 구축하는 Common Crawl의 크롤러입니다. 많은 AI 모델이 이 아카이브에서 학습 데이터를 가져옵니다.
모든 크롤러는 요청의 User-Agent 헤더에 자신을 밝힙니다. 크롤러를 식별하는 단서가 바로 이 헤더입니다.
학습과 실시간 검색: 목적이 다르면 결과도 다릅니다
학습용 크롤러는 여러분의 콘텐츠를 학습 데이터에 넣으며, 이는 앞으로 나올 모델이 무엇을 아는지를 좌우합니다. 브랜드와 전문성이 학습 데이터에 담겨 있으면, 나중에 관련 질문이 들어왔을 때 모델이 여러분을 언급할 가능성이 커집니다.
실시간 검색용 크롤러는 사용자가 질문을 던지는 바로 그 순간에 페이지를 가져옵니다. AI 엔진이 콘텐츠를 그대로 인용하면서 출처 링크를 함께 붙이는 경우가 많아, 전통적인 검색에 가까운 즉각적인 노출 효과가 있습니다.
이 구분이 왜 중요한지는 OpenAI의 사례가 잘 보여줍니다. OpenAI는 세 가지 크롤러를 문서로 공개하고 있습니다. 모델 학습용 GPTBot, ChatGPT 검색용 OAI-SearchBot, 사용자를 대신해 실시간으로 웹을 열람하는 ChatGPT-User이며, 각각 robots.txt에서 따로 제어됩니다. 따라서 GPTBot을 차단해도 ChatGPT 검색에서 사이트가 사라지지는 않습니다.
차단의 결과도 유형에 따라 다릅니다. 학습용 크롤러를 차단하면 모델이 아는 지식에서 장기적으로 빠지게 되고, 검색용 크롤러를 차단하면 AI 검색에서 즉시 보이지 않게 됩니다. 그러므로 결정을 내리기 전에 어떤 유형을 다루고 있는지부터 확인하십시오.
차단이 아니라 환영하는 robots.txt 작성하기
robots.txt의 기본 논리는 단순합니다. Disallow 규칙이 없으면 모두 허용됩니다. AI 크롤러를 명시적으로 환영하려면 이름을 하나씩 적어주십시오.
User-agent: GPTBot
Allow: /
User-agent: ClaudeBot
Allow: /
User-agent: PerplexityBot
Allow: /명시적인 Allow는 두 가지 역할을 합니다. 개방적인 입장을 선언하고, 포괄적인 Disallow 규칙의 영향에서 이 크롤러들을 지켜냅니다. 가장 흔한 자충수는 User-agent: *와 Disallow: /를 함께 쓰는 것으로, 이렇게 하면 AI 크롤러를 포함한 모든 크롤러가 차단됩니다.
사이트 루트 디렉터리에 llms.txt 파일을 추가할 수도 있습니다. llms.txt는 대규모 언어 모델을 위해 사이트의 핵심 콘텐츠를 Markdown으로 요약하는 텍스트 파일 제안이며, robots.txt를 대체하는 것이 아니라 보완합니다.
방화벽과 CDN: 가장 흔한 의도치 않은 차단
요청이 방화벽 단계에서 막히면 아무리 개방적인 robots.txt를 써 두어도 소용이 없습니다. 크롤러가 콘텐츠를 읽는 지점까지 아예 도달하지 못하기 때문입니다. 이것이 가장 흔하면서도 가장 눈에 띄지 않는 실패 원인입니다.
WAF와 CDN의 봇 관리 기능은 AI 크롤러를 악성 트래픽으로 간주해 403 오류나 CAPTCHA 페이지를 돌려주는 일이 잦습니다. 일부 CDN 사업자는 AI 크롤러 차단을 기본 설정으로 제공하기 때문에, 사이트 운영자가 몇 달 동안 차단하고 있으면서도 이를 모르는 경우가 있습니다.
확인할 곳은 세 군데입니다. CDN 또는 방화벽의 봇 관리 설정을 살펴보고, User-Agent 문자열을 대상으로 하는 차단 규칙이 있는지 찾아보며, 속도 제한이 정상적인 크롤링을 공격으로 취급하고 있지는 않은지 확인하십시오. 필요하다면 알려진 AI 크롤러를 허용 목록에 추가하십시오.
서버 로그에서 AI 크롤러 방문 확인하기
가장 직접적인 방법은 서버 접속 로그에서 GPTBot, ClaudeBot, PerplexityBot, CCBot 같은 크롤러 User-Agent 문자열을 검색하는 것입니다. 기록을 찾았다면 두 가지를 확인하십시오.
첫째, 상태 코드입니다. 200은 콘텐츠를 정상적으로 읽었다는 뜻이고, 403은 요청이 차단됐다는 뜻이며, 404는 해당 경로가 존재하지 않는다는 뜻입니다. 403이 다량으로 남아 있다면 의도치 않은 차단이 일어나고 있다는 직접적인 증거입니다.
둘째, 진위 여부입니다. User-Agent 문자열은 위조할 수 있기 때문에 일부 기업은 자사 크롤러의 공식 IP 대역을 공개하고 있으며, 역방향 DNS 조회로도 출처를 검증할 수 있습니다. 사이트 앞단에 CDN이 있다면 CDN이 차단한 요청은 원본 서버 로그에 아예 남지 않으므로, CDN 자체의 로그나 분석 화면을 확인해야 합니다.
자주 묻는 질문
GPTBot이란 무엇입니까?
GPTBot은 OpenAI의 웹 크롤러입니다. AI 모델 학습을 위해 공개된 웹 콘텐츠를 수집하며, robots.txt에서 제어할 수 있습니다.
GPTBot을 차단하면 ChatGPT 검색에서 사이트가 사라집니까?
아닙니다. ChatGPT 검색은 별도의 크롤러인 OAI-SearchBot을 사용하며, robots.txt에서도 따로 제어됩니다. GPTBot은 학습 데이터에만 관여합니다.
Google-Extended를 차단하면 Google 검색 순위가 떨어집니까?
아닙니다. Google-Extended는 AI 학습 사용에 대한 권한만 제어하며, Googlebot의 검색 색인 생성 및 순위 결정과는 별개로 동작합니다.
llms.txt란 무엇입니까?
llms.txt는 사이트 루트 디렉터리에 두는 텍스트 파일 제안입니다. AI 모델이 읽을 수 있도록 사이트의 핵심 콘텐츠를 Markdown으로 요약합니다.
AI 크롤러가 내 웹사이트를 방문했는지 어떻게 확인합니까?
서버 접속 로그에서 GPTBot, ClaudeBot 같은 User-Agent 문자열을 검색한 뒤, 상태 코드가 200인지 확인하십시오.
내 사이트가 AI에 열려 있는지 닫혀 있는지 확인하기
여기까지 읽으셨다면 내 사이트는 어떤 상태인지, robots.txt가 실수로 차단하고 있지는 않은지, AI 크롤러가 실제로 콘텐츠를 읽을 수 있는지 궁금하실 것입니다. UDomain이 무료로 제공하는 AEO Auditor(ai.ud.hk/aeo-auditor)는 사이트의 AI 가시성 설정을 점검하며, URL만 입력하면 결과를 확인할 수 있습니다. 여기서 AEO는 Answer Engine Optimization, 즉 AI 검색엔진이 콘텐츠를 쉽게 인용하도록 만드는 작업을 뜻합니다. 세관의 Authorized Economic Operator 제도나 이름이 비슷한 주식 티커와는 아무런 관련이 없습니다.

