Lo básico
¿Qué es robots.txt y por qué importa ahora con la IA?
Respuesta corta
Un robots.txt para IA es tu archivo robots.txt configurado para decidir qué bots de inteligencia artificial pueden rastrear tu web y para qué. En la IA conviven tres tipos de bots: los de entrenamiento (GPTBot, ClaudeBot), los de búsqueda (OAI-SearchBot, PerplexityBot) y los que actúan a petición de un usuario (ChatGPT-User). Puedes bloquear el entrenamiento sin perder visibilidad; si bloqueas los de búsqueda, desapareces de sus respuestas.
robots.txt es un archivo de texto plano que vive en la raíz de tu dominio (tudominio.es/robots.txt). Funciona por grupos: una línea User-agent dice a qué bot te diriges y debajo van las reglas Disallow (no entres aquí) y Allow (aquí sí). Desde septiembre de 2022 es un estándar oficial, el RFC 9309 del IETF.
Hasta hace poco bastaba con pensar en Googlebot y Bingbot. Hoy OpenAI, Anthropic, Perplexity, Meta, Apple, Amazon o Mistral publican sus propios crawlers de IA, y cada uno tiene un propósito distinto. La pregunta ya no es «¿dejo entrar a la IA, sí o no?», sino qué uso de tu contenido aceptas: que entrenen modelos con él, que lo citen en respuestas o que lo lean cuando un usuario lo pide. Eso es, en el fondo, configurar un robots.txt para IA: decidir bot a bot, no a ciegas.
Por eso, antes de bloquear bots de IA conviene saber qué hace cada uno. Bloquear el equivocado no protege nada y, en cambio, puede costarte visibilidad.
Esa decisión afecta directamente a tu SEO para IA: un bloqueo mal puesto te borra de ChatGPT Search o de Perplexity sin que nadie te avise. Si quieres el contexto completo de cómo se gana visibilidad en buscadores y motores de respuesta, lo explico en la guía de SEO, AEO y GEO.
robots.txt no es un candado
El concepto clave
GPTBot, OAI-SearchBot y ChatGPT-User: ¿por qué hay tres bots por empresa?
Porque cada uno hace un trabajo distinto y bloquearlo tiene consecuencias distintas. Es la idea clave de cualquier robots.txt para IA. OpenAI es el ejemplo más claro: no hay un único user agent de ChatGPT, sino tres, y su documentación oficial lo deja escrito: «cada ajuste es independiente de los demás».
1. Rastreadores de entrenamiento
GPTBot, ClaudeBot, Meta-ExternalAgent, CCBot o MistralAI-Training recogen textos que pueden acabar en el entrenamiento de futuros modelos. Bloquearlos no te quita de ninguna respuesta de hoy: solo indica que no quieres que tu contenido futuro alimente esos modelos. Lo que ya se recogió no se borra.
2. Rastreadores de búsqueda
OAI-SearchBot, Claude-SearchBot, PerplexityBot o Meta-WebIndexer construyen el índice del que salen las citas y enlaces de las respuestas con búsqueda. OpenAI lo dice sin rodeos: los sitios que bloquean OAI-SearchBot «no se mostrarán en las respuestas de búsqueda de ChatGPT». Estos son los que casi nunca te conviene bloquear.
3. Agentes que actúan a petición del usuario
ChatGPT-User, Claude-User, Perplexity-User o Meta-ExternalFetcher no rastrean por su cuenta: entran en una URL concreta cuando alguien pide al asistente que la lea. Aquí está la trampa: OpenAI avisa de que, al ser acciones iniciadas por un usuario, «puede que las reglas de robots.txt no se apliquen», y Perplexity, Meta y Amazon dicen algo parecido. Anthropic, en cambio, afirma que todos sus bots respetan robots.txt.
Los casos especiales: Google, Apple y Microsoft
Google no tiene un bot de IA aparte. AI Overviews y AI Mode forman parte de la Búsqueda y se alimentan de lo que rastrea Googlebot. Google-Extended no es un rastreador, sino un token de control: decide si lo ya rastreado puede usarse para entrenar Gemini y para grounding, y Google afirma que no afecta a tu inclusión ni a tu posición en la Búsqueda. Apple sigue el mismo modelo con Applebot y Applebot-Extended. Microsoft tampoco tiene un bot de IA separado: Copilot se apoya en el índice de Bingbot, y sus directrices para webmasters, reescritas en febrero de 2026, controlan el uso en Copilot con la meta etiqueta noarchive.
Lo esencial
- Bloquear un bot de entrenamiento (GPTBot, ClaudeBot) no te quita visibilidad en las respuestas de IA.
- Bloquear un bot de búsqueda (OAI-SearchBot, PerplexityBot, Claude-SearchBot) sí te saca de sus respuestas.
- No puedes salir de AI Overviews con robots.txt sin salir de Google: ambos dependen de Googlebot.
- Google-Extended y Applebot-Extended son tokens de control: solo afectan al entrenamiento.
- Varios agentes de usuario avisan de que pueden ignorar robots.txt: para un bloqueo real necesitas tu CDN o WAF.
Verificado en octubre de 2026
¿Qué bots de IA existen? Tabla de user agents verificada
Esta es la tabla que yo uso para configurar un robots.txt para IA. Cada fila está comprobada contra la documentación oficial de cada empresa a 9 de octubre de 2026; cuando el proveedor no lo detalla o hay dudas, lo indico. Los nombres cambian a menudo, así que revisa la fecha si llegas aquí dentro de unos meses.
| Criterio | Empresa | Para qué sirve | ¿Respeta robots.txt? | Si lo bloqueas… |
|---|---|---|---|---|
GPTBot | OpenAI | Entrenamiento | Sí | Tu contenido no se usa para entrenar modelos de OpenAI. No afecta a ChatGPT Search. |
OAI-SearchBot | OpenAI | Búsqueda (ChatGPT Search) | SíCambios en unas 24 h | No apareces en las respuestas de búsqueda de ChatGPT. |
ChatGPT-User | OpenAI | Acción del usuario (y GPT personalizados) | No siempre«Puede que no se apliquen», según OpenAI | Puede seguir entrando cuando un usuario se lo pida. |
ClaudeBot | Anthropic | Entrenamiento | SíAdmite también Crawl-delay | Tu contenido futuro queda fuera del entrenamiento de Claude. |
Claude-SearchBot | Anthropic | Búsqueda | Sí | Claude no indexa tu web: menos visibilidad en sus respuestas con búsqueda. |
Claude-User | Anthropic | Acción del usuario | SíAnthropic dice que todos sus bots lo respetan | Claude no puede leer tu página cuando un usuario se lo pide. |
PerplexityBot | Perplexity | BúsquedaNo entrena modelos, según Perplexity | Sí, según PerplexityCloudflare lo cuestionó en agosto de 2025 | No apareces citado ni enlazado en Perplexity. |
Perplexity-User | Perplexity | Acción del usuario | Generalmente noLo dice su propia documentación | Puede seguir visitándote a petición de usuarios. |
Googlebot | Búsqueda: Google, AI Overviews y AI Mode | Sí | Desapareces de Google, incluidos AI Overviews y AI Mode. | |
Google-Extended | Token de control (no rastrea)Entrenamiento de Gemini y grounding | Sí (solo existe en robots.txt) | Gemini no entrena con tu web. Sigues en la Búsqueda y en AI Overviews. | |
Applebot | Apple | Búsqueda: Siri, Spotlight y Safari | Sí | Sales de las búsquedas de Siri, Spotlight y Safari. |
Applebot-Extended | Apple | Token de control (no rastrea)Entrenamiento de modelos de Apple | Sí (solo existe en robots.txt) | Apple no entrena con tu web. Sigues apareciendo en sus búsquedas. |
Bingbot | Microsoft | Búsqueda: Bing y Copilot | Sí | Sales de Bing y de Copilot. Para limitar solo Copilot, usa la meta etiqueta noarchive. |
CCBot | Common Crawl | Archivo abiertoMuy usado para entrenar modelos de terceros | Sí (método de exclusión oficial) | Tus páginas no entran en los nuevos rastreos de Common Crawl. |
Meta-ExternalAgent | Meta | Entrenamiento (y mejora de productos) | Sí | Excluyes tu web del entrenamiento de los modelos de Meta. |
Meta-WebIndexer | Meta | Búsqueda de Meta AI | Sí | Meta AI no te cita ni te enlaza en sus respuestas. |
Meta-ExternalFetcher | Meta | Acción del usuario | No siempre«Puede saltarse» robots.txt, según Meta | Puede seguir entrando a petición de un usuario. |
Bytespider | ByteDance | Recogida de datosSin documentación oficial pública | Sin confirmar | Bloquéalo también en tu CDN o WAF si quieres asegurarte. |
Amazonbot | Amazon | Mejora de productosPuede usarse para entrenar modelos de Amazon | Sí | Amazon no usa tu web para esos fines. No admite Crawl-delay. |
Amzn-SearchBot | Amazon | Búsqueda (Alexa y otras) | Sí | No apareces en las experiencias de búsqueda de Amazon. |
Amzn-User | Amazon | Acción del usuario | No siempre«Puede no seguir todas las directivas» | Puede seguir entrando para responder a una petición en directo. |
MistralAI-Training | Mistral | Entrenamiento | Sí | Mistral no usa tu web para entrenar sus modelos. |
MistralAI-Index | Mistral | BúsquedaAsistente Vibe (antes Le Chat) | No lo detalla | Su buscador no indexa tu web para responder en Vibe. |
MistralAI-User | Mistral | Acción del usuario | Sí, según Mistralrobots.txt decide a qué webs puede ir | Vibe no puede abrir tu página a petición de un usuario. |
Novedades recientes que conviene tener en el radar:
- OpenAI documenta además
OAI-AdsBot, que solo visita las páginas enviadas como anuncios en ChatGPT para revisar su seguridad. No es un rastreador general. - Meta separa ya entrenamiento (
Meta-ExternalAgent), búsqueda de Meta AI (Meta-WebIndexer) y peticiones de usuario (Meta-ExternalFetcher). - Mistral publica tres agentes:
MistralAI-Training,MistralAI-IndexyMistralAI-User. Su asistente se llama ahora Vibe (antes Le Chat). - Google lista entre sus fetchers activados por usuarios a
Google-Agent, usado por agentes alojados en su infraestructura para navegar por la web. Como el resto de esa familia, «generalmente ignora» robots.txt. - Perplexity: el 4 de agosto de 2025 Cloudflare la acusó de usar rastreadores no declarados para esquivar bloqueos y la retiró de su lista de bots verificados. Perplexity rechazó la acusación. Por eso la marco con matiz en la tabla.
- ByteDance no publica documentación oficial de
Bytespiderque haya podido verificar. Cloudflare lo identificó en 2024 como el bot de IA con más peticiones de su red.
24 h
Lo que puede tardar ChatGPT Search en reflejar un cambio en tu robots.txt
OpenAI, documentación de rastreadores
4
Empresas de esta tabla que avisan de que su agente de usuario puede no respetar robots.txt
Docs. de OpenAI, Perplexity, Meta y Amazon
500 KiB
Tamaño mínimo de robots.txt que un rastreador debe ser capaz de leer
IETF, RFC 9309 (2022)
Herramienta
¿Cómo bloquear bots de IA con robots.txt?
Con un grupo por bot (o varios bots en el mismo grupo) y una regla Disallow: /. El estándar permite poner varias líneas User-agent seguidas que comparten las mismas reglas, y así queda un archivo más corto:
User-agent: GPTBot
User-agent: ClaudeBot
Disallow: /Lo que mucha gente busca como robots txt disallow es justo esta regla: Disallow: / cierra toda la web a los bots de ese grupo. Pero también puede ser parcial: Disallow: /clientes/ bloquea solo esa carpeta. Si varias reglas encajan con una URL, gana la más específica, es decir, la ruta más larga.
El error más común: los grupos no se suman
User-agent: *. Si escribes un grupo User-agent: GPTBot con Allow: /, GPTBot ya no verá tus Disallow generales de /wp-admin/ o /carrito/. Si das a un bot grupo propio, repite en él las reglas que necesites.Para no equivocarte, usa este constructor de robots.txt para IA. Elige una configuración rápida o activa y desactiva bots uno a uno: el archivo se genera al momento, las líneas nuevas se iluminan y el panel te dice qué pasa con tu visibilidad.
El constructor deja fuera de la configuración «Bloquear toda la IA» a Googlebot, Bingbot y Applebot a propósito: bloquearlos te saca también de Google, Bing y las búsquedas de Apple. Si de verdad quieres eso, puedes desactivarlos a mano.
Mi recomendación
¿Qué robots.txt para IA recomiendo a una pyme?
Para la mayoría de pymes, el mejor punto de partida es dejar pasar a todos los bots de búsqueda y de usuario, y decidir el entrenamiento con calma. Si tu web es sobre todo contenido comercial (servicios, casos, precios, guías), que los modelos conozcan tu marca suele jugar a tu favor.
# robots.txt recomendado para la mayoría de pymes (octubre de 2026)
# Objetivo: visibilidad máxima en buscadores y en la IA.
User-agent: *
Disallow: /wp-admin/
Allow: /wp-admin/admin-ajax.php
Disallow: /carrito/
Disallow: /mi-cuenta/
Disallow: /*?s=
# Rastreador sin documentación oficial pública
User-agent: Bytespider
Disallow: /
# Opcional: si NO quieres que entrenen modelos con tus textos,
# quita las almohadillas de este bloque. No afecta a tu
# visibilidad en ChatGPT Search, Perplexity ni Google.
# User-agent: GPTBot
# User-agent: ClaudeBot
# User-agent: Google-Extended
# User-agent: Applebot-Extended
# User-agent: CCBot
# User-agent: Meta-ExternalAgent
# User-agent: MistralAI-Training
# Disallow: /
Sitemap: https://www.tudominio.es/sitemap.xmlAdapta las rutas privadas a tu CMS: las del ejemplo son las típicas de WordPress con WooCommerce. El bloque de entrenamiento va comentado para que lo actives solo si encaja contigo. He dejado fuera Amazonbot porque mezcla mejora de productos y entrenamiento; añádelo si quieres ser estricto.
¿Cuándo sí compensa bloquear el entrenamiento?
robots.txt decide qué pueden leer los bots. Si además quieres sugerir a los modelos qué páginas leer primero, existe una propuesta complementaria: te cuento qué es, quién la usa de verdad y cuánto esperar de ella en la guía llms.txt: qué es y cómo crearlo.
Ojo con esto
¿Basta con robots.txt? Cloudflare, CDN y WAF
No. Puedes tener un robots.txt para IA perfecto y estar bloqueando a la IA sin saberlo, o al revés, porque tu CDN o tu firewall deciden antes que tu archivo.
El caso más importante es Cloudflare, que sirve una parte muy grande de la web. El 1 de julio de 2025 anunció que bloquea por defecto a los crawlers de IA que acceden sin permiso: desde entonces, a cada dominio nuevo se le pregunta si quiere permitirlos. La opción de bloquearlos con un clic ya existía desde 2024, y hoy se gestiona bot por bot en AI Crawl Control.
Además, Cloudflare puede servir un robots.txt gestionado que añade la línea Content-Signal: search=yes, ai-train=no. Es su Content Signals Policy (24 de septiembre de 2025): una forma de expresar preferencias de uso que, como la propia Cloudflare reconoce, algunas empresas pueden ignorar. Hoy no forma parte del estándar RFC 9309.
Revisa tu CDN antes de culpar a tu contenido
Y si necesitas que un bot no entre de verdad, la herramienta es el WAF o la CDN, no robots.txt: es la única capa que puede frenar a un agente que no respeta el archivo o que se identifica con otro nombre.
Paso a paso
¿Cómo comprobar qué bots de IA visitan tu web?
En cinco pasos y sin herramientas de pago. Te llevará menos de una hora la primera vez.
Abre tu robots.txt real
Visitatudominio.es/robots.txten el navegador: eso es lo que ven los bots, no lo que crees haber configurado en tu CMS. En Google Search Console, el informe de robots.txt te dice qué versión ha leído Google y si tiene errores. Si usas un robots.txt gestionado por tu CDN, puede no coincidir con el de tu web.Busca los user agents en los logs del servidor
Descarga el registro de accesos (Apache o Nginx, desde tu hosting) y cuenta las visitas de cada bot con el comando de abajo. Verás quién entra, con qué frecuencia y a qué URLs.Comprueba que son quienes dicen ser
El user agent se puede falsificar. Contrasta la IP con las listas oficiales: OpenAI publicagptbot.json,searchbot.jsonychatgpt-user.json; Anthropic,claude.com/crawling/bots.json; Common Crawl,ccbot.json; y Amazon y Mistral, sus propias listas.Revisa tu CDN y tu WAF
En Cloudflare, mira AI Crawl Control y los eventos de seguridad: qué bots se bloquean y con qué código. Si OAI-SearchBot o PerplexityBot reciben 403, tu robots.txt da igual.Comprueba el resultado en las respuestas
Pregunta a ChatGPT con búsqueda, Perplexity y Copilot por tu servicio y tu marca, y anota si te citan y con qué URL. Repite cada mes con las mismas preguntas para medir la evolución.
# ¿Qué bots de IA han pasado por tu web? (log de Apache o Nginx)
BOTS="GPTBot|OAI-SearchBot|ChatGPT-User|Claude|Perplexity|CCBot|Bytespider"
BOTS="$BOTS|Meta-External|Meta-WebIndexer|Amazonbot|Amzn-|Applebot|MistralAI"
grep -oiE "[A-Za-z-]*($BOTS)[A-Za-z-]*" access.log | sort | uniq -c | sort -rnDudas habituales
Preguntas frecuentes sobre el robots.txt para IA
¿Cuál es el user agent de ChatGPT?
ChatGPT no tiene un único user agent, sino tres: GPTBot recoge contenido para entrenar los modelos de OpenAI, OAI-SearchBot decide si apareces en las respuestas de búsqueda de ChatGPT y ChatGPT-User entra cuando un usuario le pide leer una página. Por eso bloquear el user agent de ChatGPT para entrenamiento (GPTBot) no te quita de ChatGPT: OpenAI documenta que cada ajuste es independiente.
¿Qué es ClaudeBot y debo bloquearlo?
ClaudeBot es el rastreador con el que Anthropic recoge contenido web que puede usarse para entrenar sus modelos Claude. Bloquearlo indica que tu contenido futuro debe quedar fuera del entrenamiento, pero no te saca de las respuestas de Claude con búsqueda, que dependen de Claude-SearchBot y Claude-User. Si tu web es sobre todo contenido comercial, normalmente compensa dejarlo pasar.
¿Cómo bloquear bots de IA sin salir de Google?
Para bloquear bots de IA sin salir de Google, pon en robots.txt los rastreadores de entrenamiento, búsqueda y usuario de cada empresa de IA, añade Google-Extended y Applebot-Extended, y deja pasar Googlebot, Bingbot y Applebot. El límite: AI Overviews y AI Mode usan Googlebot, así que no puedes salir de ellos con robots.txt sin salir de Google; solo puedes limitar los fragmentos con nosnippet o max-snippet.
¿Google-Extended me saca de AI Overviews?
No. Google-Extended no es un rastreador, sino un token de control: indica si el contenido que Google ya rastrea puede usarse para entrenar futuros modelos Gemini y para grounding en otros sistemas de Google. Google afirma que no afecta a la inclusión ni al posicionamiento en la Búsqueda, y AI Overviews y AI Mode forman parte de la Búsqueda, controlada por Googlebot.
¿Los crawlers de IA respetan siempre robots.txt?
No hay garantía. El propio estándar RFC 9309 dice que robots.txt no es una forma de autorización de acceso. Los grandes proveedores declaran que sus crawlers de IA automáticos lo respetan, pero OpenAI, Perplexity, Meta y Amazon avisan de que sus agentes activados por un usuario pueden no seguirlo. Si necesitas un bloqueo real, configúralo también en tu CDN o en tu WAF.
¿Cuánto tarda en aplicarse un cambio en el robots.txt para IA?
Normalmente, alrededor de un día. El RFC 9309 pide no usar una copia en caché de más de 24 horas; OpenAI habla de unas 24 horas para ChatGPT Search, y Perplexity, Meta y Amazon dan plazos similares. Ojo: un cambio en tu robots.txt para IA no borra lo que ya se rastreó ni lo que un modelo ya aprendió; solo afecta a lo que pase a partir de ese momento.
¿Bloquear bots de IA afecta a mi SEO en Google?
No, si lo haces bien. Bloquear bots de IA como GPTBot, ClaudeBot, PerplexityBot o Google-Extended no afecta a tu posicionamiento en Google, que dice expresamente que Google-Extended no es una señal de ranking. El riesgo está en los errores, como un robots txt disallow demasiado amplio (Disallow: / bajo User-agent: *) o bloquear Googlebot por accidente. Revisa el archivo en el informe de robots.txt de Search Console tras cada cambio.
Verificación
Fuentes
Todas consultadas el 9 de octubre de 2026. Los nombres y el comportamiento de los bots cambian a menudo: si algo no cuadra, la fuente oficial manda.
- OpenAI: Overview of OpenAI Crawlers (GPTBot, OAI-SearchBot, ChatGPT-User, OAI-AdsBot).
- Anthropic: Does Anthropic crawl data from the web, and how can site owners block the crawler?
- Perplexity: Perplexity Crawlers
- Google Search Central: Google’s common crawlers (Googlebot, Google-Extended).
- Google Search Central: AI features and your website
- Google Search Central: Google’s user-triggered fetchers (Google-Agent).
- Apple: About Applebot
- Bing Webmaster Blog: opciones para controlar el uso de tu contenido en Bing Chat (22 de septiembre de 2023)
- Bing Webmaster Guidelines y resumen de los cambios de febrero de 2026 en Search Engine Journal
- Common Crawl: CCBot
- Meta for Developers: Meta Web Crawlers
- Amazon: Amazonbot, Amzn-SearchBot y Amzn-User
- Mistral AI: Robots
- IETF: RFC 9309, Robots Exclusion Protocol (septiembre de 2022)
- Cloudflare: nota de prensa del 1 de julio de 2025 y documentación de AI Crawl Control
- Cloudflare: Content Signals Policy (24 de septiembre de 2025)
- Cloudflare: informe sobre los rastreadores no declarados de Perplexity (4 de agosto de 2025)
- Tom’s Guide: la respuesta de Perplexity a Cloudflare (agosto de 2025)
- heise: el asistente de Mistral pasa a llamarse Vibe
- Cloudflare: Declaring your AIndependence (3 de julio de 2024)
Este artículo se ha creado con ayuda de la IA y lo ha revisado José Galán. Cuido mucho cada publicación y cada traducción, pero aun así se puede colar algún error. Si encuentras uno, escríbeme: me ayudarás a mejorar.
Search & AI Visibility
¿Quieres saber si la IA puede leer (y citar) tu web?
Reviso tu robots.txt, tu CDN y tus logs, compruebo qué bots de IA te visitan de verdad y mido si apareces en ChatGPT, Perplexity, Copilot y AI Overviews. Con un informe claro de qué cambiar y por qué.
Ver el servicio