Rastreadores de IA
Los rastreadores de IA son bots con los que los proveedores de IA obtienen páginas web, ya sea para reunir datos de entrenamiento para sus modelos o para cargar contenido actual cuando un usuario hace una consulta. Muchos proveedores usan para ello user agents distintos, de modo que el entrenamiento y la búsqueda se pueden controlar por separado.
Tres tipos de acceso
En la mayoría de los proveedores se distinguen tres finalidades:
- Entrenamiento: El bot reúne textos que más tarde pueden entrar en el entrenamiento de nuevas versiones del modelo.
- Búsqueda: El bot construye un índice del que el sistema elige y cita fuentes al responder preguntas.
- Consulta en nombre de un usuario: El bot carga justo la página que un usuario ha indicado en el chat o que el sistema necesita para una respuesta.
| Proveedor | Entrenamiento | Búsqueda | Consulta para usuarios |
|---|---|---|---|
| OpenAI | GPTBot | OAI-SearchBot | ChatGPT-User |
| Anthropic | ClaudeBot | Claude-SearchBot | Claude-User |
| Perplexity | – | PerplexityBot | Perplexity-User |
| Google-Extended (token) | Googlebot | – | |
| Common Crawl | CCBot | – | – |
Google-Extended no es un rastreador propio, sino un token para el robots.txt. Regula si los contenidos pueden usarse para el entrenamiento y el grounding de Gemini, y no influye en la Búsqueda de Google ni en las AI Overviews. Para ellas valen los controles de la Búsqueda de Google: una página tiene que estar indexada y poder mostrarse con fragmento para ser enlazada como fuente. Quien no quiera aparecer allí limita la presentación en la propia búsqueda, por ejemplo con nosnippet.
Control mediante el robots.txt
Con el robots.txt decides por separado si tus contenidos pueden usarse para el entrenamiento y si pueden aparecer en búsquedas con IA. Quien bloquea los rastreadores de búsqueda no puede ser citado como fuente en los sistemas correspondientes.
# Prohibir el entrenamiento de IA, permitir la búsqueda con IA
User-agent: GPTBot
Disallow: /
User-agent: ClaudeBot
Disallow: /
User-agent: Google-Extended
Disallow: /
User-agent: CCBot
Disallow: /
User-agent: OAI-SearchBot
Allow: /
User-agent: Claude-SearchBot
Allow: /
User-agent: PerplexityBot
Allow: /
Bloquear los bots de entrenamiento solo afecta al entrenamiento futuro. No deshace lo que un modelo ya conoce de datos anteriores.
Lo que el robots.txt no consigue
- Es una petición, no un bloqueo. Los proveedores serios la respetan, pero técnicamente no se puede imponer.
- Las consultas en nombre de usuarios se tratan, según algunos proveedores, no o solo en parte según el robots.txt, porque una persona ha desencadenado la solicitud. Lee la documentación del proveedor correspondiente.
- El user agent se puede falsificar. Quien quiera estar seguro comprueba además la dirección IP. Varios proveedores publican los rangos de direcciones de sus rastreadores.
Reconocer y comprobar rastreadores
En los registros del servidor ves qué bots solicitan tus páginas y con qué frecuencia. Filtra por los nombres de la tabla. Comprueba también si un servicio previo, como una CDN o un cortafuegos, bloquea los bots de IA en bloque. Algunos proveedores ofrecen interruptores o reglas por defecto para ello, y entonces ni el mejor robots.txt sirve de nada.
Muchos rastreadores de IA no ejecutan JavaScript. Por eso, los contenidos importantes deben estar en el HTML entregado (consulta JavaScript SEO).
Errores frecuentes
- Bloquear todos los bots de IA en bloque: Quien excluye también los rastreadores de búsqueda no aparece como fuente en esos sistemas.
- Pensar solo en un bot de un proveedor: Entrenamiento, búsqueda y consulta de usuario son nombres distintos. Una regla para GPTBot no vale para OAI-SearchBot.
- Escribir mal los nombres: El robots.txt compara el nombre del bot. Una errata deja la regla sin efecto.
- No volver a mirar: Los proveedores añaden y cambian sus bots. Compara la lista de vez en cuando con la documentación actual.
Términos relacionados
- robots.txt: regular el acceso a tu sitio web
- llms.txt: archivo de orientación propuesto para modelos de lenguaje
- Datos de entrenamiento: de dónde sacan los modelos su conocimiento
- RAG (Retrieval-Augmented Generation): cómo obtienen fuentes los sistemas de IA
- GEO (Generative Engine Optimization): optimizar contenidos para respuestas de IA
Fuentes
- OpenAI: Overview of OpenAI Crawlers
- Anthropic: Does Anthropic crawl data from the web?
- Perplexity: Perplexity Crawlers
- Google Search Central: Descripción general de los rastreadores de Google
- Google Search Central: Funciones de IA y tu sitio web