¿Debo dejar que GPTBot rastree mi sitio web?
Sí, salvo que vendas el contenido. Pero la pregunta esconde otra: GPTBot no es el robot que decide si apareces en ChatGPT. Lo que vimos en los registros de nuestro propio servidor, incluidas 293 visitas que decían ser de OpenAI y Perplexity, de las que 21 eran reales.
Sí. Si tu empresa vende un servicio o un producto, y no el contenido de su sitio, conviene dejar que GPTBot entre. El costo es casi nulo y bloquearlo no protege nada que te importe.
Pero la pregunta trae otra escondida, y esa es la que vale la pena contestar. La mayoría de quienes preguntan por GPTBot lo hacen porque quieren aparecer en ChatGPT, o porque no aparecen. Y GPTBot no es el robot que decide eso. Es el que menos tiene que ver.
Los tres robots de OpenAI, y cuál decide si apareces
OpenAI manda tres robots distintos a la web, con tres nombres y tres propósitos. Se confunden todo el tiempo, incluso en artículos de agencias, y la confusión sale cara porque cada uno se controla por separado en el mismo archivo.
| Robot | Qué hace | Cuándo te sirve |
|---|---|---|
| GPTBot | Recolecta páginas para entrenar los modelos del futuro | En meses, si es que sirve |
| OAI-SearchBot | Busca en la web para armar la respuesta que alguien está leyendo ahora | Hoy: decide si apareces |
| ChatGPT-User | Va a leer una página porque un usuario la pegó o la pidió | Hoy, en esa conversación |
Lo que dice OpenAI en su propia documentación, y que ChatGPT cita y Gemini repite al responder esta pregunta, es que bloquear a GPTBot no te saca de las respuestas con búsqueda: esas dependen de OAI-SearchBot. Son puertas distintas.
Es lo mismo en los otros asistentes. Anthropic tiene ClaudeBot para entrenamiento y Claude-SearchBot para buscar; Perplexity tiene PerplexityBot y Perplexity-User. Y nada de esto es una clasificación nuestra: es la que usa Cloudflare en su panel de control de rastreadores, con tres categorías que conviene aprenderse porque ordenan todo lo demás.
- Entrenamiento: ingiere contenido para entrenar e indexar. Si paga, paga en meses.
- Búsqueda: trae páginas para construir la respuesta que el usuario está leyendo en ese momento.
- Asistente: va a buscar una dirección porque un usuario la pidió recién.
Las dos últimas son las que deciden si apareces. La primera es GPTBot.
Qué pasa si bloqueas GPTBot
Tres cosas, y solo tres.
- Tus páginas dejan de entrar al material con el que OpenAI entrena sus próximos modelos. Lo que el modelo ya aprendió de ti no se borra.
- No cambia nada en las respuestas con búsqueda de ChatGPT, mientras OAI-SearchBot y ChatGPT-User sigan con permiso.
- Ahorras un tráfico que, en un sitio de servicios, no se nota.
Hay casos donde bloquearlo tiene sentido: un medio con contenido de pago, una editorial, una base de datos que se vende por suscripción, un sitio con datos personales que no deberían estar en ningún corpus. Ahí el contenido es el negocio, y regalarlo para entrenar un modelo que después lo resume gratis es una decisión de negocio que cada uno toma.
Para una clínica, un estudio de abogados o una agencia, el contenido del sitio existe para que alguien elija contratarlos. Que un modelo lo aprenda es parte de ese objetivo, no una fuga.
Qué pasa si lo dejas entrar
Nada visible, en la práctica. Y esa es la parte que conviene tener medida en vez de imaginada.
En agosto revisamos qué robots de IA entraban a skaut.cl durante 24 horas, desde el panel de Cloudflare. GPTBot hizo 10 peticiones y se llevó 45 kB en total. Una foto de portada pesa más. ClaudeBot hizo 21, Meta-ExternalAgent 31. Ninguna falló.
Al mirar una semana completa, y ya verificando que las visitas fueran reales (sobre eso, más abajo), GPTBot había venido 4 veces.
Ese es el costo de dejarlo entrar en un sitio de servicios: cuatro visitas por semana, unos kilobytes. La discusión sobre GPTBot en internet es mucho más grande que GPTBot.
Lo que vimos en nuestro propio servidor
Lo contamos porque nos corrigió una idea que teníamos.
Cuando empezamos a medir, dábamos por hecho que nuestro problema era competir por la recomendación: que los asistentes nos leían y preferían a otro. La lectura del servidor dijo otra cosa. En esas primeras 24 horas, los robots de entrenamiento hicieron 63 peticiones. Los de búsqueda, 8, y todas de Applebot. Los de asistente, cero. OAI-SearchBot, el que decide si apareces en ChatGPT, no había pasado ni una vez.
Doce horas después, con una segunda lectura por API, apareció: 5 visitas de OAI-SearchBot, 2 de PerplexityBot. La reserva que habíamos escrito ese mismo día, que 24 horas no prueban un "nunca", quedó demostrada contra nosotros mismos antes de que la afirmación llegara a ningún cliente.
Y a tres días, el cuadro completo: los rastreadores de entrenamiento nos
visitaron 159 veces; los que deciden respuestas, 27. De esas, el robot
de búsqueda de ChatGPT hizo 10 de sus 11 visitas a un solo archivo,
robots.txt. Llegaba a la puerta, comprobaba que estuviera abierta, y se iba
sin entrar.
Ahí está la respuesta de fondo a la pregunta de este artículo. GPTBot era el robot que más nos visitaba, con permiso total, y no nos servía de nada para aparecer. El que sí servía apenas venía, y no por falta de permiso: por falta de razones para entrar. Nadie nos enlazaba, así que no tenía direcciones nuestras que buscar.
El robot que dice ser GPTBot puede no serlo
Esto lo aprendimos el 25 de agosto, y cambió cómo leemos cualquier registro.
Nuestra herramienta de lectura reportó, sobre siete días, 136 peticiones de ChatGPT-User, 59 de OAI-SearchBot y 50 de PerplexityBot, casi todas fallidas. La conclusión automática era alarmante: los robots que deciden si aparecemos estaban intentando leernos y no podían.
Lo que delató el error fueron las direcciones pedidas. "ChatGPT-User" había
pedido /.aws/credentials, /.ssh/id_rsa, /terraform.tfstate y unas 190
rutas del mismo tipo. Un asistente que va a leer un sitio para responderle a
alguien lee la portada y el blog. No busca la llave privada del servidor.
El nombre del robot es un campo de texto que escribe quien hace la petición. Nadie lo comprueba. Lo único que no se puede falsificar es desde qué red llega, y OpenAI y Perplexity publican los rangos de direcciones de sus robots justamente para esto. Al cruzar las peticiones con esos rangos:
| Decía ser | Peticiones | Venían de su red |
|---|---|---|
| ChatGPT-User | 136 | 1 |
| OAI-SearchBot | 59 | 12 |
| PerplexityBot | 50 | 4 |
| GPTBot | 49 | 4 |
| Total | 293 | 21 |
Veintiuna de 293: el 7%. Y una sola dirección IP se presentó como los cuatro a la vez. Era un escáner buscando credenciales, y usaba nombres de asistentes porque muchos sitios bloquean a los escáneres conocidos y a los asistentes los dejan pasar.
Para la pregunta de este artículo, esto importa en dos direcciones. Si decides bloquear GPTBot por lo que ves en tus registros, primero verifica que lo que ves sea GPTBot. Y si decides permitirlo, no midas el efecto contando visitas por nombre: la mayoría pueden no ser suyas. Anthropic no publica rangos, y Google, Microsoft y Apple usan otro mecanismo, así que para esos robots la verificación por IP no está disponible y sus cifras quedan sin comprobar.
El error que teníamos en nuestro propio robots.txt
Hasta el 18 de agosto, el archivo robots.txt de skaut.cl nombraba a cuatro
robots con permiso explícito, GPTBot, ClaudeBot, PerplexityBot y
Google-Extended, con un comentario que decía que eran "requisito para
aparecer en las respuestas".
Tres de esos cuatro son de entrenamiento. Los que de verdad deciden si apareces, OAI-SearchBot, ChatGPT-User, Claude-SearchBot, no estaban nombrados. Entraban igual, porque la regla general permitía todo, así que no había bloqueo. Pero el archivo decía lo contrario de lo que medíamos, y es el mismo archivo que le revisamos a cada cliente.
Lo corregimos ese día. Y anotamos en el propio archivo que no era la palanca:
el robot de búsqueda de ChatGPT ya entraba sin problema y seguía sin
avanzar más allá de robots.txt. Se arregla porque es correcto, no porque
vaya a mover la aguja.
Cómo decidir, según tu caso
- Vendes un servicio o un producto físico. Permite a todos: GPTBot, OAI-SearchBot, ChatGPT-User y sus equivalentes de Anthropic, Perplexity y Google. No hay nada que proteger y sí mucho que ganar.
- Vendes el contenido, con muro de pago, licencias o suscripción. Bloquea a los de entrenamiento (GPTBot, ClaudeBot, Google-Extended, Applebot-Extended) y deja abiertos a los de búsqueda y asistente, para seguir apareciendo en las respuestas sin regalar el archivo completo.
- Tienes datos personales publicados que no deberían estar en ningún corpus. Ese contenido no debería estar en una página pública, con o sin GPTBot; el robot es el síntoma.
- Tu sitio está detrás de Cloudflare y es reciente. Antes de decidir nada, revisa la configuración de rastreo de IA: en los dominios nuevos el bloqueo viene activado por defecto y tu sitio puede estar respondiendo "prohibido" a todos los robots de IA sin que nadie lo haya decidido. Nos pasó, y lo desactivamos a mano.
Cómo se escribe
El archivo robots.txt va en la raíz del sitio y admite una regla por
robot. Este es el nuestro, que permite a todos y los nombra uno por uno para
que quede claro cuál es cuál:
User-agent: *
Allow: /
# Búsqueda y asistente: los que deciden si apareces
User-agent: OAI-SearchBot
Allow: /
User-agent: ChatGPT-User
Allow: /
User-agent: PerplexityBot
Allow: /
User-agent: Perplexity-User
Allow: /
User-agent: Claude-SearchBot
Allow: /
User-agent: Claude-User
Allow: /
User-agent: Google-Extended
Allow: /
# Entrenamiento: se permiten, pero pagan en meses
User-agent: GPTBot
Allow: /
User-agent: ClaudeBot
Allow: /
User-agent: Applebot-Extended
Allow: /
Para bloquear solo a GPTBot, se cambia su Allow: / por Disallow: /. Para
bloquearlo en una sección y no en el resto, Disallow: /privado/ bajo su
bloque. OpenAI declara que GPTBot respeta este archivo, y en nuestra medición
no vimos ninguna petición suya a rutas que no correspondieran.
Lo que el archivo no hace es traer al robot. Un permiso es una puerta abierta, no una invitación. Si el robot de búsqueda de ChatGPT no tiene tu dirección en ningún lado, va a seguir sin venir con la puerta abierta de par en par, que es exactamente lo que nos pasaba a nosotros.
Por dónde seguir
Si la razón de fondo de tu pregunta es que tu empresa no aparece en ChatGPT, GPTBot casi seguro no es el motivo. Los cortes posibles son cuatro y vienen en orden: si los robots entran, si te usan de fuente, si te nombran, y si lo que dicen es correcto. Están explicados uno por uno en ¿Por qué mi empresa no aparece en ChatGPT?.
Y si quieres saber en cuál estás tú, con tus preguntas de compra y tus competidores, pide un diagnóstico gratis: medimos qué responden hoy ChatGPT, Claude, Gemini y Perplexity sobre tu rubro, y te lo enviamos en menos de 5 días hábiles.
Preguntas frecuentes
¿Bloquear GPTBot me saca de las respuestas de ChatGPT?
No. GPTBot recolecta páginas para entrenar los modelos de OpenAI. El robot que busca en la web para las respuestas de ChatGPT es otro, OAI-SearchBot, y el que va a leer una página porque un usuario la pidió es ChatGPT-User. Puedes bloquear a GPTBot y seguir apareciendo en las respuestas con búsqueda, siempre que los otros dos tengan la puerta abierta.
¿Cómo se bloquea o se permite GPTBot?
En el archivo robots.txt del sitio, con una regla por robot. Para permitirlo: User-agent: GPTBot seguido de Allow: /. Para bloquearlo: User-agent: GPTBot seguido de Disallow: /. OpenAI declara que GPTBot respeta ese archivo. Si el sitio está detrás de Cloudflare, además hay que revisar la configuración de rastreo de IA, porque en dominios nuevos el bloqueo viene activado por defecto.
¿Cuánto tráfico consume GPTBot?
Poco. En skaut.cl, GPTBot hizo 10 peticiones en 24 horas y descargó 45 kB en total, menos que una foto. En una semana completa las visitas reales de GPTBot fueron 4. Un sitio de servicios no nota el costo; un medio con miles de páginas puede notarlo, y es una razón legítima para limitarlo por secciones.
¿Cómo sé si el que entró a mi sitio era GPTBot de verdad?
Comprobando desde qué red llegó. El nombre del robot es un texto que escribe quien hace la petición y nadie verifica. OpenAI publica los rangos de direcciones IP de cada uno de sus robots; si la petición no viene de ahí, no es de OpenAI. En skaut.cl, de 293 peticiones que decían ser de OpenAI o Perplexity en siete días, 21 venían de sus redes.
¿Conviene bloquear todos los robots de IA para proteger el contenido?
Solo si el contenido es lo que vendes. Si bloqueas también a los robots de búsqueda y de asistente, no a GPTBot solamente, tu sitio deja de poder ser citado en las respuestas de ChatGPT, Perplexity y Claude, y esa es la única forma en que hoy un asistente recomienda a una empresa. Para una empresa que vende un servicio, cerrar esa puerta cuesta más de lo que protege.
Skaut trabaja el posicionamiento de marcas en asistentes de IA: ChatGPT, Claude, Perplexity y Gemini. Más sobre cómo trabajamos →