In this Article
Robots.txt es el archivo de texto de 30 años de antigüedad que indica a los crawlers qué partes de un sitio pueden obtener. En 2026, está cumpliendo una función para la que nunca fue diseñado: arbitrar la web de la IA, donde decenas de crawlers — GPTBot, ClaudeBot, PerplexityBot, Google-Extended y más — extraen contenido para entrenar modelos y responder preguntas en tiempo real. Esta guía cubre lo que robots.txt puede y no puede hacer en la era de la IA, el panorama de crawlers, si los bots de IA realmente lo obedecen, las señales más nuevas (llms.txt, controles de Cloudflare) y lo que todo esto significa tanto si haces scraping de la web como si administras un sitio que es scrapeado.
Soy Andrii Byzov, AI-Native Fractional CMO, y trabajo todos los días con pipelines de datos web y visibilidad en búsquedas con IA. A continuación, encontrarás una visión práctica y actualizada a 2026, con las advertencias honestas. Para el aspecto legal, consulta nuestra guía is web scraping legal; para la visibilidad en IA, nuestro artículo sobre AI search rank tracking.
Datos clave
- robots.txt es voluntario, no es ley. Es una solicitud (formalizada como RFC 9309), aplicada mediante el cumplimiento de buena fe y por servidores/CDN, no por estatuto.
- El entrenamiento y la búsqueda ahora usan rastreadores separados. Puedes bloquear el entrenamiento de IA (GPTBot, Google-Extended, ClaudeBot) y seguir siendo elegible para citas en búsquedas con IA (OAI-SearchBot, Claude-SearchBot, PerplexityBot).
- Las solicitudes de agentes en tiempo real suelen omitir la lógica de robots.txt. Cuando un usuario le pide a una IA que lea una página, podría decirse que esa solicitud no proviene de un “rastreador”, por lo que robots.txt puede no detenerla.
- El cumplimiento varía según el bot. Los rastreadores principales (Googlebot, GPTBot, ClaudeBot) generalmente respetan robots.txt; algunos históricamente no lo han hecho, y una directiva solo funciona si el bot decide leerla.
- Existen nuevas señales: llms.txt (guía a la IA hacia tu mejor contenido, ~10% de adopción), además de los controles de bloqueo de IA y pago por rastreo de Cloudflare en la capa de CDN.
Qué es robots.txt — y qué no es — en 2026
robots.txt es un archivo de texto sin formato en la raíz de un dominio (/robots.txt) que enumera user-agents y las rutas que se les pide no recuperar. Se estandarizó como RFC 9309 en 2022, pero la idea central no ha cambiado desde 1994: es una solicitud cortés. No autentica a nadie, no bloquea el acceso a nivel de red y no tiene fuerza legal por sí solo. Un crawler bien comportado lo lee y lo cumple; un crawler que lo ignora no enfrenta ninguna barrera técnica por parte del archivo en sí.
Esa distinción es toda la historia en la era de la IA. robots.txt rige lo que los bots compatibles aceptan no hacer; no es un candado. La aplicación real (limitación de tasa, bloqueo, paywalls) ocurre en el servidor o CDN, no en el archivo de texto.
El panorama de los crawlers de IA
La web de IA es rastreada por un elenco cada vez mayor, y el cambio importante es que cada proveedor principal ahora separa el tráfico de entrenamiento del tráfico de búsqueda/respuesta en distintos user-agents:
| User-agent | Operador | Propósito | ¿Respeta robots.txt? |
|---|---|---|---|
| GPTBot | OpenAI | Entrenamiento de modelos | Sí (documentado) |
| OAI-SearchBot | OpenAI | Búsqueda / citas de ChatGPT | Sí |
| ClaudeBot | Anthropic | Entrenamiento de modelos | Sí |
| Claude-SearchBot | Anthropic | Búsqueda / citas | Sí |
| Google-Extended | Token de exclusión para entrenamiento de Gemini | Sí (solo token) | |
| PerplexityBot | Perplexity | Búsqueda / respuestas | Sí (documentado) |
| CCBot | Common Crawl | Conjunto de datos abierto (alimenta muchos modelos) | Sí |
| Meta-ExternalAgent | Meta | Entrenamiento / funciones de IA | Sí |
Como el entrenamiento y la búsqueda son agentes separados, un sitio puede tomar una decisión matizada: excluirse de ser usado para entrenar modelos y, al mismo tiempo, seguir siendo elegible para ser citado en respuestas de IA; por ejemplo, bloquear GPTBot pero permitir OAI-SearchBot.
¿Los crawlers de IA realmente obedecen robots.txt?
En su mayoría, los grandes sí lo hacen, y es fácil verificarlo desde los registros de tu propio servidor. Googlebot, GPTBot, ClaudeBot y PerplexityBot documentan sus user-agents y respetan las directivas estándar. Pero importan tres advertencias honestas:
- El cumplimiento es voluntario. Una directiva solo funciona si el bot la lee y la respeta. Históricamente, algunos crawlers han ignorado robots.txt, y un user-agent falsificado puede afirmar ser cualquier cosa; por eso, el archivo es una norma, no una garantía.
- Las recuperaciones de agentes en tiempo real son una zona gris. Cuando una persona le pide a ChatGPT o Perplexity que resuma una URL específica, la herramienta recupera esa página en nombre del usuario. Los proveedores suelen tratar esto como acceso dirigido por el usuario en lugar de crawling, por lo que las reglas de entrenamiento/crawl de robots.txt quizá no se apliquen como esperan los propietarios de sitios.
- La capa de CDN puede anularte. Una investigación sobre la red de Cloudflare encontró que una proporción significativa de sitios bloqueaba accidentalmente a crawlers de IA importantes en el CDN mientras su robots.txt decía “allow”; ambas capas deben coincidir.
Más allá de robots.txt: llms.txt, ai.txt y pago por crawl
robots.txt rige el acceso; un archivo más nuevo, llms.txt, rige la navegación: dirige a los sistemas de IA hacia tu contenido de mayor valor y más limpio. La adopción aún está en una etapa temprana (aproximadamente 10% de los dominios), pero es una señal de bajo riesgo. Además, los CDNs han entrado en escena: Cloudflare ofrece bloqueo de crawlers de IA con un clic y un modelo de pago por crawl que permite a los publishers cobrar a las empresas de IA por el acceso, llevando la conversación de “permitir/denegar” hacia “licenciar”. La conclusión para 2026: robots.txt es una capa en una pila que ahora incluye llms.txt, controles de CDN y términos comerciales emergentes.
Qué significa esto si extraes datos de la web
Si recopilas datos web públicos, trata robots.txt como una norma profesional, no como un obstáculo que hay que esquivar. La postura defendible y sostenible:
- Lee y respeta robots.txt para las rutas que visitas, y respeta crawl-delay cuando esté configurado. Es la base de una recopilación ética y de buena fe.
- Recopila datos públicos de solo lectura — no eludas inicios de sesión ni extraigas datos personales — y mantén tasas razonables para no degradar el sitio objetivo. (Consulta is web scraping legal para el marco legal.)
- Usa proxies obtenidos de forma ética. La recopilación legítima se realiza mediante IPs residenciales limpias y con consentimiento, además de una rotación sensata — no mediante redes que ocultan tráfico abusivo. Esta es exactamente la razón por la que importan los proxies for web scraping y cómo se obtienen.
Que robots.txt sea “solo una solicitud” no es una licencia para ignorarlo — los riesgos prácticos del scraping agresivo son bloqueos de IP, desafíos de CDN y fricción reputacional y contractual, todo lo cual se evita con buenas prácticas.
Qué significa esto si administras un sitio
Decide deliberadamente y luego haz que robots.txt y tu CDN estén alineados:
- ¿Quieres visibilidad en búsquedas con IA? Permite los agentes de búsqueda/respuesta (OAI-SearchBot, Claude-SearchBot, PerplexityBot) para seguir siendo elegible para citas — los visitantes referidos por IA son un canal de rápido crecimiento y alta intención.
- ¿No quieres alimentar el entrenamiento? Bloquea los crawlers de entrenamiento (GPTBot, Google-Extended, ClaudeBot) mientras mantienes permitidos los agentes de búsqueda.
- Verifica ambas capas. Comprueba que tu CDN no esté bloqueando (o exponiendo) en silencio lo que pretende tu robots.txt, y considera un llms.txt para guiar a los agentes hacia tus mejores páginas.
- Prueba lo que los agentes realmente ven. Debido a que las respuestas y los rastreos de IA están geopersonalizados, revisar tu sitio y su visibilidad en IA desde IPs en distintos países (mediante proxies residenciales) te muestra la imagen real, no solo tu vista local.
Preguntas frecuentes
¿robots.txt es legalmente vinculante?
No. robots.txt (estandarizado como RFC 9309) es una solicitud voluntaria que los rastreadores bien comportados respetan. No tiene fuerza legal por sí mismo y no bloquea técnicamente el acceso; la aplicación real ocurre en el servidor o CDN.
¿Puedo permitir que la IA cite mi sitio, pero que no lo use para entrenamiento?
Sí. Los proveedores ahora separan los rastreadores de entrenamiento y de búsqueda, por lo que puedes bloquear agentes de entrenamiento (GPTBot, Google-Extended, ClaudeBot) y permitir agentes de búsqueda (OAI-SearchBot, Claude-SearchBot, PerplexityBot) que te hacen elegible para citas en respuestas de IA.
¿Los rastreadores de IA realmente siguen robots.txt?
Los principales rastreadores documentados (Googlebot, GPTBot, ClaudeBot, PerplexityBot) generalmente lo hacen, y puedes verificarlo en los registros del servidor. Pero el cumplimiento es voluntario, las solicitudes en tiempo real activadas por usuarios son una zona gris, y existen user-agents falsificados; por lo tanto, es una norma, no una garantía.
¿Qué es llms.txt y lo necesito?
llms.txt es un archivo más reciente que guía a los sistemas de IA hacia tu contenido más valioso: robots.txt regula el acceso, llms.txt regula la navegación. Su adopción aún está en una etapa temprana (~10% de los dominios), pero es una señal de bajo esfuerzo y bajo riesgo que vale la pena agregar.
¿Importa respetar robots.txt al hacer scraping?
Sí. Aunque no sea legalmente vinculante, respetar robots.txt y crawl-delay es la base del scraping ético y sostenible: te mantiene en un terreno defendible y evita bloqueos, desafíos de CDN y riesgos reputacionales.
Recopila datos web públicos de la manera correcta
Ya sea que estés construyendo una canalización de datos de IA o monitoreando cómo la IA representa tu marca, la recopilación ética comienza por respetar las señales de los sitios y operar con IPs limpias y consentidas. Obtén proxies residenciales de origen ético desde $1/GB — pago por uso, 190+ países, con el control geográfico necesario para probar y recopilar de forma responsable.
