AI가 내 사이트를 인용하려면 먼저 '읽을 수 있어야' 합니다
챗GPT·퍼플렉시티·클로드 같은 생성형 AI가 특정 브랜드나 제품을 답변에 인용하려면, 해당 AI의 크롤러가 사이트를 실제로 수집할 수 있어야 합니다. 그런데 많은 사이트가 오래된 robots.txt 설정을 그대로 두거나, 보안 목적으로 모든 봇을 막아 둔 채 "왜 AI가 우리를 소개하지 않느냐"고 의아해합니다. AI 인용의 출발점은 콘텐츠 품질이기도 하지만, 그 이전에 크롤러 접근 허용 여부가 선행 조건입니다.
GEO(Generative Engine Optimization)와 AEO(Answer Engine Optimization)는 AI 검색 환경에서 브랜드와 콘텐츠가 노출되도록 최적화하는 전략입니다. 두 전략 모두 AI 크롤러가 사이트를 정상적으로 수집한다는 전제 위에 작동합니다. robots.txt 설정은 기술적으로 단순하지만, 놓치면 이후의 모든 GEO·AEO 노력이 허공에 흩어집니다.
주요 AI 크롤러 목록과 User-agent 이름
각 AI 서비스는 자체 크롤러를 운영하며, robots.txt에서 인식하는 User-agent 이름이 정해져 있습니다. 아래 표에 현재(2025년 기준) 확인된 주요 AI 크롤러를 정리했습니다. User-agent 이름은 대소문자를 구분하므로 정확히 입력해야 합니다.
| AI 서비스 | 크롤러 User-agent | 운영사 |
|---|---|---|
| ChatGPT / GPT 학습 | GPTBot | OpenAI |
| Claude | ClaudeBot | Anthropic |
| Perplexity AI | PerplexityBot | Perplexity AI |
| Google Gemini (검색 연동) | Google-Extended | |
| Meta AI | FacebookBot | Meta |
| Common Crawl (다수 AI 학습에 활용) | CCBot | Common Crawl |
OpenAI는 GPTBot 외에 ChatGPT-User라는 별도 에이전트도 운영합니다. GPTBot은 학습 데이터 수집용이고, ChatGPT-User는 사용자가 챗GPT에서 Browse 기능으로 실시간 검색할 때 사용됩니다. 두 가지 모두 허용하려면 각각 별도 규칙을 작성해야 합니다.
robots.txt 작성법 — 허용·차단·부분 허용 세 가지 패턴
robots.txt는 사이트 루트(예: https://example.com/robots.txt)에 위치하는 텍스트 파일입니다. 기본 문법은 User-agent로 대상 봇을 지정하고, Allow 또는 Disallow로 접근 범위를 설정하는 구조입니다. 아래에 실제로 사용할 수 있는 세 가지 패턴을 정리했습니다.
- 패턴 1 — 전체 허용 (기본값, 아무 규칙도 없을 때와 동일)
User-agent: GPTBot
Allow: / - 패턴 2 — 전체 차단 (학습 데이터 제공을 원하지 않을 때)
User-agent: GPTBot
Disallow: / - 패턴 3 — 특정 디렉터리만 차단, 나머지 허용 (가장 현실적인 선택)
User-agent: GPTBot
Disallow: /private/
Disallow: /member/
Allow: /
ClaudeBot·PerplexityBot·Google-Extended도 동일한 문법으로 작성합니다. 각 봇을 별도 블록으로 구분하는 것이 가독성과 유지보수 측면에서 권장됩니다. 하나의 User-agent: * 규칙이 이미 있다면, 특정 봇을 개별 허용하려면 해당 봇 전용 블록을 파일 상단에 별도로 추가해야 합니다. 나중에 작성된 블록보다 앞에 위치한 개별 규칙이 우선 적용됩니다.
실제 파일 예시는 아래와 같습니다.
# 기존 검색엔진 설정
User-agent: *
Disallow: /private/
Disallow: /member/
# AI 크롤러 개별 허용
User-agent: GPTBot
Allow: /
User-agent: ChatGPT-User
Allow: /
User-agent: ClaudeBot
Allow: /
User-agent: PerplexityBot
Allow: /
User-agent: Google-Extended
Allow: /
설정 후 반드시 확인해야 할 세 가지
robots.txt를 수정했다고 해서 즉시 AI 크롤러가 사이트를 수집하는 것은 아닙니다. 각 크롤러는 자체 일정에 따라 주기적으로 방문하며, 수집 후 학습·인덱싱까지 별도 시간이 소요됩니다. 설정의 정확성과 이후 운영을 위해 아래 세 가지를 점검하시기 바랍니다.
- 문법 오류 검사: Google Search Console의 robots.txt 테스터, 또는 무료 온라인 도구(예: technicalseo.com)를 활용해 작성한 규칙이 의도대로 동작하는지 확인합니다.
- HTTPS와 www 버전 일치 여부: http와 https, www와 non-www 각 도메인에서 robots.txt가 동일하게 응답하는지 확인합니다. 크롤러는 접속한 프로토콜 기준으로 파일을 읽습니다.
- 서버 응답 코드 확인: robots.txt 파일이 200 OK를 반환해야 합니다. 404나 500을 반환하면 크롤러마다 해석이 달라 예상치 못한 차단이 발생할 수 있습니다.
또한 robots.txt는 크롤러에 대한 '권고'이지 강제가 아닙니다. 규칙을 무시하는 악성 봇은 별도의 서버 차원 방어(방화벽, .htaccess 등)가 필요합니다. 반면 OpenAI·Anthropic·Google 등 주요 AI 기업의 공식 크롤러는 robots.txt를 준수하는 것으로 공식 문서에 명시하고 있습니다.
robots.txt 허용만으로 AI 인용이 보장되지 않는 이유
robots.txt 허용은 AI 인용을 위한 필요조건이지 충분조건이 아닙니다. 크롤러가 접근할 수 있어도, 페이지 내 콘텐츠가 특정 질문에 답하기에 충분히 구체적이고 신뢰할 수 있어야 AI가 해당 페이지를 인용 출처로 선택합니다. 실제로 AI 답변의 인용 출처는 매월 40~60%가량 변동한다는 점에서, 한 번 인용됐다고 안심하기도 어렵습니다.
실무에서 확인된 사례처럼, AI가 단종된 제품을 브랜드의 대표 상품으로 소개하거나 영업시간을 잘못 안내하는 일도 발생합니다. 이는 크롤러가 오래된 페이지를 수집했거나, 최신 정보가 AI 학습에 반영되지 않은 탓입니다. 따라서 robots.txt 설정과 함께 콘텐츠 최신화, 구조화 데이터(Schema.org) 적용, 권위 있는 외부 출처로부터의 언급 확보 등을 병행해야 합니다.
GEO·AEO는 단발성 기술 설정이 아니라 지속적인 모니터링과 콘텐츠 관리가 요구되는 전략입니다. AI 크롤러에게 문을 열어 두는 것이 시작이라면, 문으로 들어온 크롤러가 가져갈 만한 정보를 꾸준히 정비하는 것이 본론입니다.
타이드웍스가 하는 일
타이드웍스는 GEO·AEO를 포함한 AI 검색 최적화와 커머스 성장 실무를 함께 다룹니다. 챗GPT·제미나이·클로드·퍼플렉시티·네이버 등 AI 5개 엔진에서 브랜드와 제품이 어떻게 인용되는지를 실측 파이프라인으로 추적하고, 인용 품질을 개선하기 위한 콘텐츠·기술 설정을 함께 점검합니다.
robots.txt 설정처럼 단순해 보이는 기술 사항부터, 월 40~60%씩 바뀌는 AI 인용 출처에 대응하는 콘텐츠 전략까지, 브랜드가 AI 검색 환경에서 지속적으로 노출될 수 있도록 실무 관점에서 지원합니다. AI가 내 브랜드를 어떻게 소개하는지 한번 점검해 보고 싶으신 분은 타이드웍스에 문의해 주세요.