In this Article
Robots.txt는 크롤러에 사이트의 어느 부분을 가져와도 되는지 알려 주는 30년 된 텍스트 파일입니다. 2026년에는 원래 설계되지 않았던 일을 맡고 있습니다. GPTBot, ClaudeBot, PerplexityBot, Google-Extended 등을 비롯한 수십 개의 크롤러가 모델 학습과 실시간 질의 응답을 위해 콘텐츠를 가져오는 AI 웹의 중재 역할입니다. 이 가이드에서는 AI 시대에 robots.txt가 할 수 있는 일과 할 수 없는 일, 크롤러 환경, AI 봇이 실제로 이를 준수하는지, 새로운 신호(llms.txt, Cloudflare 제어), 그리고 웹을 스크래핑하거나 스크래핑되는 사이트를 운영할 때의 의미를 다룹니다.
저는 웹 데이터 파이프라인과 AI 검색 노출을 매일 다루는 AI 네이티브 프랙셔널 CMO, Andrii Byzov입니다. 아래에서는 솔직한 단서를 포함한 2026년 최신의 실용적인 관점을 제시합니다. 법적 측면은 웹 스크래핑은 정당한가 가이드를, AI 노출은 AI 검색 순위 추적 글을 참조하십시오.
핵심 사실
- robots.txt는 자발적 요청이며 법이 아닙니다. 이는 RFC 9309로 공식화된 요청으로, 법률이 아니라 선의의 준수와 서버/CDN에 의해 시행됩니다.
- 이제 학습과 검색에는 별도의 크롤러가 사용됩니다. AI 학습(GPTBot, Google-Extended, ClaudeBot)은 차단하면서도 AI 검색 인용(OAI-SearchBot, Claude-SearchBot, PerplexityBot) 대상 자격은 유지할 수 있습니다.
- 실시간 에이전트 가져오기는 robots.txt 논리를 우회하는 경우가 많습니다. 사용자가 AI에 페이지를 읽어 달라고 요청할 때의 가져오기는 엄밀히 말해 “크롤러”가 아닐 수 있으므로 robots.txt가 이를 막지 못할 수 있습니다.
- 준수 여부는 봇마다 다릅니다. 주요 크롤러(Googlebot, GPTBot, ClaudeBot)는 대체로 robots.txt를 준수하지만, 과거에 그렇지 않았던 경우도 있으며 지시문은 봇이 읽기로 선택할 때에만 작동합니다.
- 새로운 신호도 있습니다. llms.txt(AI를 가장 좋은 콘텐츠로 안내, 약 10% 도입)와 CDN 계층의 Cloudflare AI 차단 및 크롤링당 과금 제어입니다.
2026년의 robots.txt, 그리고 robots.txt가 아닌 것
robots.txt는 도메인의 루트(/robots.txt)에 있는 일반 텍스트 파일로, 사용자 에이전트와 가져오지 않도록 요청하는 경로를 나열합니다. 2022년에 RFC 9309로 표준화되었지만, 핵심 개념은 1994년 이후 변하지 않았습니다. 즉, 정중한 요청입니다. 누구의 신원도 인증하지 않고 네트워크 수준에서 접근을 차단하지 않으며, 그 자체로 법적 효력도 없습니다. 예의 바른 크롤러는 이를 읽고 준수하지만, 이를 무시하는 크롤러는 파일 자체로 인한 기술적 장벽에 부딪히지 않습니다.
이 차이가 AI 시대의 핵심입니다. robots.txt는 준수하는 봇이 하지 않기로 동의한 일을 규정할 뿐, 자물쇠가 아닙니다. 실제 적용은 텍스트 파일이 아니라 서버 또는 CDN에서 속도 제한, 차단, 유료 장벽으로 이루어집니다.
AI 크롤러 환경
AI 웹에는 점점 더 많은 크롤러가 활동하며, 중요한 변화는 각 주요 제공업체가 이제 학습 트래픽과 검색/응답 트래픽을 서로 다른 사용자 에이전트로 분리한다는 점입니다.
| 사용자 에이전트 | 운영자 | 목적 | robots.txt 준수 여부 |
|---|---|---|---|
| GPTBot | OpenAI | 모델 학습 | 예(문서화됨) |
| OAI-SearchBot | OpenAI | ChatGPT 검색 / 인용 | 예 |
| ClaudeBot | Anthropic | 모델 학습 | 예 |
| Claude-SearchBot | Anthropic | 검색 / 인용 | 예 |
| Google-Extended | Gemini 학습 거부 토큰 | 예(토큰만) | |
| PerplexityBot | Perplexity | 검색 / 답변 | 예(문서화됨) |
| CCBot | Common Crawl | 공개 데이터세트(여러 모델에 제공) | 예 |
| Meta-ExternalAgent | Meta | 학습 / AI 기능 | 예 |
학습과 검색이 별도 에이전트이므로 사이트는 세밀하게 선택할 수 있습니다. 예를 들어 모델 학습에는 사용되지 않으면서 AI 답변에 인용될 자격은 유지할 수 있습니다. GPTBot은 차단하되 OAI-SearchBot은 허용하면 됩니다.
AI 크롤러는 실제로 robots.txt를 준수합니까?
대체로 주요 크롤러는 준수하며, 자체 서버 로그에서 쉽게 확인할 수 있습니다. Googlebot, GPTBot, ClaudeBot, PerplexityBot은 사용자 에이전트를 문서화하고 표준 지시문을 존중합니다. 다만 솔직히 짚어야 할 세 가지 단서가 있습니다.
- 준수는 선택 사항입니다. 지시문은 봇이 이를 읽고 준수할 때에만 작동합니다. 일부 크롤러는 과거에 robots.txt를 무시했으며, 위조된 사용자 에이전트는 무엇이든 주장할 수 있으므로 이 파일은 보증이 아니라 규범입니다.
- 실시간 에이전트 가져오기는 회색 지대입니다. 사용자가 ChatGPT 또는 Perplexity에 특정 URL을 요약해 달라고 요청하면 도구가 그 페이지를 사용자를 대신하여 가져옵니다. 제공업체는 이를 크롤링이 아니라 사용자 지시 접근으로 취급하는 경우가 많으므로 robots.txt의 학습/크롤링 규칙이 사이트 소유자가 기대하는 방식으로 적용되지 않을 수 있습니다.
- CDN 계층이 의도와 다르게 작동할 수 있습니다. Cloudflare 네트워크 연구에서는 robots.txt가 “허용”이라고 명시한 상태에서도 상당수의 사이트가 CDN에서 주요 AI 크롤러를 의도치 않게 차단하는 것으로 나타났습니다. 두 계층은 일치해야 합니다.
robots.txt를 넘어: llms.txt, ai.txt, 크롤링당 과금
robots.txt는 접근을 규정하고, 더 새로운 파일인 llms.txt는 탐색을 규정합니다. AI 시스템을 가장 가치 있고 정확한 콘텐츠로 안내합니다. 도입은 아직 초기 단계(도메인의 약 10%)이지만 위험이 낮은 신호입니다. 이와 함께 CDN도 참여하고 있습니다. Cloudflare는 AI 크롤러 원클릭 차단과, 게시자가 AI 기업에 접근 비용을 청구할 수 있는 크롤링당 과금 모델을 제공합니다. 이는 논의를 “허용/거부”에서 “라이선스”로 옮깁니다. 2026년의 핵심은 robots.txt가 이제 llms.txt, CDN 제어, 새롭게 등장하는 상업 조건을 포함하는 계층 구조의 한 층이라는 점입니다.
웹을 스크래핑한다면 이것이 의미하는 것
공개 웹 데이터를 수집한다면 robots.txt를 피해 갈 장애물이 아니라 전문적인 규범으로 대하십시오. 방어 가능하고 지속 가능한 태도는 다음과 같습니다.
- 접근하는 경로의 robots.txt를 읽고 존중하며, 설정된 경우 crawl-delay를 준수하십시오. 이는 선의에 기반한 윤리적 수집의 기본선입니다.
- 공개된 읽기 전용 데이터를 수집하고 로그인 절차를 우회하거나 개인 데이터를 스크래핑하지 마십시오. 또한 대상 사이트의 성능을 저하시키지 않도록 합리적인 속도를 유지하십시오. 법적 관점은 웹 스크래핑은 정당한가를 참조하십시오.
- 윤리적으로 확보된 프록시를 사용하십시오. 정당한 수집은 동의를 받은 깨끗한 레지덴셜 프록시(residential proxy) IP와 합리적인 로테이팅을 통해 이루어지며, 악의적 트래픽을 숨기는 네트워크를 통해 이루어지지 않습니다. 바로 이 때문에 웹 스크래핑용 프록시와 그 확보 방식이 중요합니다.
robots.txt가 “그저 요청”이라는 사실은 이를 무시할 허가가 아닙니다. 공격적인 스크래핑의 실질적 위험에는 IP 차단, CDN 검증, 평판 및 계약상 마찰이 있으며, 모두 좋은 관행으로 피할 수 있습니다.
사이트를 운영한다면 이것이 의미하는 것
의도적으로 결정한 다음 robots.txt와 CDN이 일치하도록 하십시오.
- AI 검색 노출을 원하십니까? 검색/응답 에이전트(OAI-SearchBot, Claude-SearchBot, PerplexityBot)를 허용하여 인용 대상 자격을 유지하십시오. AI를 통해 유입되는 방문자는 빠르게 성장하는 고의도 채널입니다.
- 학습에 제공하고 싶지 않으십니까? 검색 에이전트는 허용한 채 학습 크롤러(GPTBot, Google-Extended, ClaudeBot)를 차단하십시오.
- 두 계층을 모두 확인하십시오. CDN이 robots.txt의 의도와 달리 조용히 차단하거나 노출하지 않는지 확인하고, 에이전트를 가장 좋은 페이지로 안내하기 위해 llms.txt를 고려하십시오.
- 에이전트가 실제로 보는 내용을 테스트하십시오. AI 답변과 크롤링은 지역별로 개인화되므로, 레지덴셜 프록시를 통해 여러 국가의 IP에서 사이트와 AI 노출을 확인하면 자택에서 보는 화면뿐 아니라 실제 상황을 알 수 있습니다.
자주 묻는 질문
robots.txt는 법적 구속력이 있습니까?
아니요. RFC 9309로 표준화된 robots.txt는 예의 바른 크롤러가 준수하는 자발적 요청입니다. 그 자체로 법적 효력은 없으며 기술적으로 접근을 차단하지도 않습니다. 실제 적용은 서버 또는 CDN에서 이루어집니다.
AI가 제 사이트를 인용하게 하되 학습에는 사용하지 못하게 할 수 있습니까?
예. 제공업체는 이제 학습용과 검색용 크롤러를 분리하므로, AI 답변 인용 대상 자격을 부여하는 검색 에이전트(OAI-SearchBot, Claude-SearchBot, PerplexityBot)는 허용하면서 학습 에이전트(GPTBot, Google-Extended, ClaudeBot)는 차단할 수 있습니다.
AI 크롤러는 실제로 robots.txt를 따릅니까?
문서화된 주요 크롤러(Googlebot, GPTBot, ClaudeBot, PerplexityBot)는 대체로 따르며 서버 로그에서 확인할 수 있습니다. 하지만 준수는 선택 사항이고, 사용자가 유발한 실시간 가져오기는 회색 지대이며, 위조된 사용자 에이전트도 존재합니다. 따라서 이는 보증이 아니라 규범입니다.
llms.txt란 무엇이며 필요한가요?
llms.txt는 AI 시스템을 가장 가치 있는 콘텐츠로 안내하는 새 파일입니다. robots.txt는 접근을 규정하고 llms.txt는 탐색을 규정합니다. 도입은 아직 초기 단계(도메인의 약 10%)이지만, 추가할 가치가 있는 적은 노력과 낮은 위험의 신호입니다.
스크래핑할 때 robots.txt를 존중하는 것이 중요합니까?
예. 법적 구속력은 없지만 robots.txt와 crawl-delay를 준수하는 일은 윤리적이고 지속 가능한 스크래핑의 기본선입니다. 이는 방어 가능한 범위에 머물게 하고 차단, CDN 검증, 평판 위험을 피하게 합니다.
올바른 방식으로 공개 웹 데이터를 수집하십시오
AI 데이터 파이프라인을 구축하든 AI가 브랜드를 어떻게 표현하는지 모니터링하든, 윤리적 수집은 사이트 신호를 존중하고 동의를 받은 깨끗한 IP에서 실행하는 일에서 시작합니다. $1/GB부터 윤리적으로 확보된 레지덴셜 프록시를 이용하십시오. 종량제 방식으로 190+개 국가를 지원하며, 책임 있게 테스트하고 수집할 수 있는 지역 제어 기능을 제공합니다.
