SKAUT®
Volver al blog
Blog
Agencias

¿Debo dejar que GPTBot rastree mi sitio web?

Sí, salvo que vendas el contenido. Pero la pregunta esconde otra: GPTBot no es el robot que decide si apareces en ChatGPT. Lo que vimos en los registros de nuestro propio servidor, incluidas 293 visitas que decían ser de OpenAI y Perplexity, de las que 21 eran reales.

Publicado: 10 de septiembre de 2026

Sí. Si tu empresa vende un servicio o un producto, y no el contenido de su sitio, conviene dejar que GPTBot entre. El costo es casi nulo y bloquearlo no protege nada que te importe.

Pero la pregunta trae otra escondida, y esa es la que vale la pena contestar. La mayoría de quienes preguntan por GPTBot lo hacen porque quieren aparecer en ChatGPT, o porque no aparecen. Y GPTBot no es el robot que decide eso. Es el que menos tiene que ver.

Los tres robots de OpenAI, y cuál decide si apareces

OpenAI manda tres robots distintos a la web, con tres nombres y tres propósitos. Se confunden todo el tiempo, incluso en artículos de agencias, y la confusión sale cara porque cada uno se controla por separado en el mismo archivo.

RobotQué haceCuándo te sirve
GPTBotRecolecta páginas para entrenar los modelos del futuroEn meses, si es que sirve
OAI-SearchBotBusca en la web para armar la respuesta que alguien está leyendo ahoraHoy: decide si apareces
ChatGPT-UserVa a leer una página porque un usuario la pegó o la pidióHoy, en esa conversación

Lo que dice OpenAI en su propia documentación, y que ChatGPT cita y Gemini repite al responder esta pregunta, es que bloquear a GPTBot no te saca de las respuestas con búsqueda: esas dependen de OAI-SearchBot. Son puertas distintas.

Es lo mismo en los otros asistentes. Anthropic tiene ClaudeBot para entrenamiento y Claude-SearchBot para buscar; Perplexity tiene PerplexityBot y Perplexity-User. Y nada de esto es una clasificación nuestra: es la que usa Cloudflare en su panel de control de rastreadores, con tres categorías que conviene aprenderse porque ordenan todo lo demás.

  • Entrenamiento: ingiere contenido para entrenar e indexar. Si paga, paga en meses.
  • Búsqueda: trae páginas para construir la respuesta que el usuario está leyendo en ese momento.
  • Asistente: va a buscar una dirección porque un usuario la pidió recién.

Las dos últimas son las que deciden si apareces. La primera es GPTBot.

Qué pasa si bloqueas GPTBot

Tres cosas, y solo tres.

  1. Tus páginas dejan de entrar al material con el que OpenAI entrena sus próximos modelos. Lo que el modelo ya aprendió de ti no se borra.
  2. No cambia nada en las respuestas con búsqueda de ChatGPT, mientras OAI-SearchBot y ChatGPT-User sigan con permiso.
  3. Ahorras un tráfico que, en un sitio de servicios, no se nota.

Hay casos donde bloquearlo tiene sentido: un medio con contenido de pago, una editorial, una base de datos que se vende por suscripción, un sitio con datos personales que no deberían estar en ningún corpus. Ahí el contenido es el negocio, y regalarlo para entrenar un modelo que después lo resume gratis es una decisión de negocio que cada uno toma.

Para una clínica, un estudio de abogados o una agencia, el contenido del sitio existe para que alguien elija contratarlos. Que un modelo lo aprenda es parte de ese objetivo, no una fuga.

Qué pasa si lo dejas entrar

Nada visible, en la práctica. Y esa es la parte que conviene tener medida en vez de imaginada.

En agosto revisamos qué robots de IA entraban a skaut.cl durante 24 horas, desde el panel de Cloudflare. GPTBot hizo 10 peticiones y se llevó 45 kB en total. Una foto de portada pesa más. ClaudeBot hizo 21, Meta-ExternalAgent 31. Ninguna falló.

Al mirar una semana completa, y ya verificando que las visitas fueran reales (sobre eso, más abajo), GPTBot había venido 4 veces.

Ese es el costo de dejarlo entrar en un sitio de servicios: cuatro visitas por semana, unos kilobytes. La discusión sobre GPTBot en internet es mucho más grande que GPTBot.

Lo que vimos en nuestro propio servidor

Lo contamos porque nos corrigió una idea que teníamos.

Cuando empezamos a medir, dábamos por hecho que nuestro problema era competir por la recomendación: que los asistentes nos leían y preferían a otro. La lectura del servidor dijo otra cosa. En esas primeras 24 horas, los robots de entrenamiento hicieron 63 peticiones. Los de búsqueda, 8, y todas de Applebot. Los de asistente, cero. OAI-SearchBot, el que decide si apareces en ChatGPT, no había pasado ni una vez.

Doce horas después, con una segunda lectura por API, apareció: 5 visitas de OAI-SearchBot, 2 de PerplexityBot. La reserva que habíamos escrito ese mismo día, que 24 horas no prueban un "nunca", quedó demostrada contra nosotros mismos antes de que la afirmación llegara a ningún cliente.

Y a tres días, el cuadro completo: los rastreadores de entrenamiento nos visitaron 159 veces; los que deciden respuestas, 27. De esas, el robot de búsqueda de ChatGPT hizo 10 de sus 11 visitas a un solo archivo, robots.txt. Llegaba a la puerta, comprobaba que estuviera abierta, y se iba sin entrar.

Ahí está la respuesta de fondo a la pregunta de este artículo. GPTBot era el robot que más nos visitaba, con permiso total, y no nos servía de nada para aparecer. El que sí servía apenas venía, y no por falta de permiso: por falta de razones para entrar. Nadie nos enlazaba, así que no tenía direcciones nuestras que buscar.

El robot que dice ser GPTBot puede no serlo

Esto lo aprendimos el 25 de agosto, y cambió cómo leemos cualquier registro.

Nuestra herramienta de lectura reportó, sobre siete días, 136 peticiones de ChatGPT-User, 59 de OAI-SearchBot y 50 de PerplexityBot, casi todas fallidas. La conclusión automática era alarmante: los robots que deciden si aparecemos estaban intentando leernos y no podían.

Lo que delató el error fueron las direcciones pedidas. "ChatGPT-User" había pedido /.aws/credentials, /.ssh/id_rsa, /terraform.tfstate y unas 190 rutas del mismo tipo. Un asistente que va a leer un sitio para responderle a alguien lee la portada y el blog. No busca la llave privada del servidor.

El nombre del robot es un campo de texto que escribe quien hace la petición. Nadie lo comprueba. Lo único que no se puede falsificar es desde qué red llega, y OpenAI y Perplexity publican los rangos de direcciones de sus robots justamente para esto. Al cruzar las peticiones con esos rangos:

Decía serPeticionesVenían de su red
ChatGPT-User1361
OAI-SearchBot5912
PerplexityBot504
GPTBot494
Total29321

Veintiuna de 293: el 7%. Y una sola dirección IP se presentó como los cuatro a la vez. Era un escáner buscando credenciales, y usaba nombres de asistentes porque muchos sitios bloquean a los escáneres conocidos y a los asistentes los dejan pasar.

Para la pregunta de este artículo, esto importa en dos direcciones. Si decides bloquear GPTBot por lo que ves en tus registros, primero verifica que lo que ves sea GPTBot. Y si decides permitirlo, no midas el efecto contando visitas por nombre: la mayoría pueden no ser suyas. Anthropic no publica rangos, y Google, Microsoft y Apple usan otro mecanismo, así que para esos robots la verificación por IP no está disponible y sus cifras quedan sin comprobar.

El error que teníamos en nuestro propio robots.txt

Hasta el 18 de agosto, el archivo robots.txt de skaut.cl nombraba a cuatro robots con permiso explícito, GPTBot, ClaudeBot, PerplexityBot y Google-Extended, con un comentario que decía que eran "requisito para aparecer en las respuestas".

Tres de esos cuatro son de entrenamiento. Los que de verdad deciden si apareces, OAI-SearchBot, ChatGPT-User, Claude-SearchBot, no estaban nombrados. Entraban igual, porque la regla general permitía todo, así que no había bloqueo. Pero el archivo decía lo contrario de lo que medíamos, y es el mismo archivo que le revisamos a cada cliente.

Lo corregimos ese día. Y anotamos en el propio archivo que no era la palanca: el robot de búsqueda de ChatGPT ya entraba sin problema y seguía sin avanzar más allá de robots.txt. Se arregla porque es correcto, no porque vaya a mover la aguja.

Cómo decidir, según tu caso

  • Vendes un servicio o un producto físico. Permite a todos: GPTBot, OAI-SearchBot, ChatGPT-User y sus equivalentes de Anthropic, Perplexity y Google. No hay nada que proteger y sí mucho que ganar.
  • Vendes el contenido, con muro de pago, licencias o suscripción. Bloquea a los de entrenamiento (GPTBot, ClaudeBot, Google-Extended, Applebot-Extended) y deja abiertos a los de búsqueda y asistente, para seguir apareciendo en las respuestas sin regalar el archivo completo.
  • Tienes datos personales publicados que no deberían estar en ningún corpus. Ese contenido no debería estar en una página pública, con o sin GPTBot; el robot es el síntoma.
  • Tu sitio está detrás de Cloudflare y es reciente. Antes de decidir nada, revisa la configuración de rastreo de IA: en los dominios nuevos el bloqueo viene activado por defecto y tu sitio puede estar respondiendo "prohibido" a todos los robots de IA sin que nadie lo haya decidido. Nos pasó, y lo desactivamos a mano.

Cómo se escribe

El archivo robots.txt va en la raíz del sitio y admite una regla por robot. Este es el nuestro, que permite a todos y los nombra uno por uno para que quede claro cuál es cuál:

User-agent: *
Allow: /

# Búsqueda y asistente: los que deciden si apareces
User-agent: OAI-SearchBot
Allow: /
User-agent: ChatGPT-User
Allow: /
User-agent: PerplexityBot
Allow: /
User-agent: Perplexity-User
Allow: /
User-agent: Claude-SearchBot
Allow: /
User-agent: Claude-User
Allow: /
User-agent: Google-Extended
Allow: /

# Entrenamiento: se permiten, pero pagan en meses
User-agent: GPTBot
Allow: /
User-agent: ClaudeBot
Allow: /
User-agent: Applebot-Extended
Allow: /

Para bloquear solo a GPTBot, se cambia su Allow: / por Disallow: /. Para bloquearlo en una sección y no en el resto, Disallow: /privado/ bajo su bloque. OpenAI declara que GPTBot respeta este archivo, y en nuestra medición no vimos ninguna petición suya a rutas que no correspondieran.

Lo que el archivo no hace es traer al robot. Un permiso es una puerta abierta, no una invitación. Si el robot de búsqueda de ChatGPT no tiene tu dirección en ningún lado, va a seguir sin venir con la puerta abierta de par en par, que es exactamente lo que nos pasaba a nosotros.

Por dónde seguir

Si la razón de fondo de tu pregunta es que tu empresa no aparece en ChatGPT, GPTBot casi seguro no es el motivo. Los cortes posibles son cuatro y vienen en orden: si los robots entran, si te usan de fuente, si te nombran, y si lo que dicen es correcto. Están explicados uno por uno en ¿Por qué mi empresa no aparece en ChatGPT?.

Y si quieres saber en cuál estás tú, con tus preguntas de compra y tus competidores, pide un diagnóstico gratis: medimos qué responden hoy ChatGPT, Claude, Gemini y Perplexity sobre tu rubro, y te lo enviamos en menos de 5 días hábiles.

Preguntas frecuentes

¿Bloquear GPTBot me saca de las respuestas de ChatGPT?

No. GPTBot recolecta páginas para entrenar los modelos de OpenAI. El robot que busca en la web para las respuestas de ChatGPT es otro, OAI-SearchBot, y el que va a leer una página porque un usuario la pidió es ChatGPT-User. Puedes bloquear a GPTBot y seguir apareciendo en las respuestas con búsqueda, siempre que los otros dos tengan la puerta abierta.

¿Cómo se bloquea o se permite GPTBot?

En el archivo robots.txt del sitio, con una regla por robot. Para permitirlo: User-agent: GPTBot seguido de Allow: /. Para bloquearlo: User-agent: GPTBot seguido de Disallow: /. OpenAI declara que GPTBot respeta ese archivo. Si el sitio está detrás de Cloudflare, además hay que revisar la configuración de rastreo de IA, porque en dominios nuevos el bloqueo viene activado por defecto.

¿Cuánto tráfico consume GPTBot?

Poco. En skaut.cl, GPTBot hizo 10 peticiones en 24 horas y descargó 45 kB en total, menos que una foto. En una semana completa las visitas reales de GPTBot fueron 4. Un sitio de servicios no nota el costo; un medio con miles de páginas puede notarlo, y es una razón legítima para limitarlo por secciones.

¿Cómo sé si el que entró a mi sitio era GPTBot de verdad?

Comprobando desde qué red llegó. El nombre del robot es un texto que escribe quien hace la petición y nadie verifica. OpenAI publica los rangos de direcciones IP de cada uno de sus robots; si la petición no viene de ahí, no es de OpenAI. En skaut.cl, de 293 peticiones que decían ser de OpenAI o Perplexity en siete días, 21 venían de sus redes.

¿Conviene bloquear todos los robots de IA para proteger el contenido?

Solo si el contenido es lo que vendes. Si bloqueas también a los robots de búsqueda y de asistente, no a GPTBot solamente, tu sitio deja de poder ser citado en las respuestas de ChatGPT, Perplexity y Claude, y esa es la única forma en que hoy un asistente recomienda a una empresa. Para una empresa que vende un servicio, cerrar esa puerta cuesta más de lo que protege.

ℹ️

Skaut trabaja el posicionamiento de marcas en asistentes de IA: ChatGPT, Claude, Perplexity y Gemini. Más sobre cómo trabajamos →

Artículos relacionados

Agencias

¿Qué busca ChatGPT por dentro antes de responderte?

Cuando preguntas por la mejor clínica de tu comuna, ChatGPT no busca eso: corre varias búsquedas propias, y algunas llevan el nombre de la empresa que ya eligió. Capturamos cientos de esas búsquedas internas y muestran dos peleas distintas — entrar a la lista, y sobrevivir la verificación.

3 sept 2026
Clínicas dentales

¿Me conviene pagar avisos en ChatGPT para mi clínica?

ChatGPT ya vende publicidad y desde abril acepta servicios dentales. Las dos fórmulas que deciden, el punto donde uno deja de convenir y empieza el otro, y los casos donde te conviene el aviso — que los hay.

1 sept 2026
Agencias

¿Se puede garantizar aparecer en ChatGPT?

No, y quien te lo prometa está adivinando con tu plata. Lo que muestran nuestras mediciones sobre por qué nadie controla estas respuestas, qué promesas circulan en el mercado, y qué es lo único que un proveedor honesto sí puede garantizar.

24 ago 2026