Respuesta breve
Los bots de IA hacen tres trabajos distintos: entrenar modelos, construir índices de búsqueda y traer páginas al usuario al instante. Cada gran laboratorio documenta bots separados por propósito, así que puedes bloquear el entrenamiento conservando la visibilidad en las respuestas. Las peticiones de usuario suelen ignorar robots.txt, y Cloudflare estrena bloqueos por defecto el 15 de septiembre de 2026.
La pregunta de si conviene bloquear los bots de IA se ha vuelto tres preguntas, porque los bots hacen ya tres trabajos con tres consecuencias distintas. Quien los trata como una sola decisión suele bloquear la pieza equivocada.
¿Qué bots llegan, y qué hacen?
OpenAI documenta cuatro agentes: GPTBot recoge datos de entrenamiento, OAI-SearchBot construye el índice de búsqueda, ChatGPT-User trae páginas a petición del usuario y OAI-AdsBot revisa anuncios. La documentación es directa sobre la consecuencia: un sitio que cierra el paso a OAI-SearchBot desaparece también de las respuestas de búsqueda de ChatGPT, mientras que un GPTBot bloqueado solo detiene el entrenamiento. Anthropic hace la misma división con ClaudeBot, Claude-SearchBot y Claude-User, y Google separa Googlebot, el control de entrenamiento Google-Extended y el nuevo bot de agentes Google-Agent, de marzo de 2026.
La división vuelve manejable la decisión: bloquear el entrenamiento y conservar la visibilidad son dos líneas distintas de robots.txt. Meta documenta la misma partición en tres en su documentación de rastreadores, donde también figura el bot de índice de búsqueda Meta-WebIndexer.
¿Obedecen los bots a robots.txt?
En parte, y la diferencia está documentada. La documentación de rastreadores de Google indica que las peticiones activadas por un usuario suelen ignorar robots.txt porque una persona pidió la página, y OpenAI y Perplexity escriben lo mismo sobre sus equivalentes. La medición de TollBit del cuarto trimestre de 2025, recogida por Digiday en febrero de 2026, halló además que el 30 % de las lecturas de IA pasaba por encima de las reglas de robots.txt, y en ChatGPT-User hasta el 42 %. Robots.txt es una declaración de intenciones; el bloqueo real exige cortafuegos o CDN.
¿Qué cambia en la infraestructura?
- Cloudflare clasifica el tráfico de IA en búsqueda, agente y entrenamiento desde julio de 2026, y bloquea entrenamiento y agentes por defecto en dominios nuevos con publicidad desde el 15 de septiembre de 2026
- El estándar del IETF para preferencias de IA, con autores de Google y Mozilla, alcanza su hito final en agosto de 2026 con una regla Content-Usage para robots.txt
- Web Bot Auth permite a los bots identificarse de forma criptográfica, y Google prueba el protocolo para sus agentes desde mayo de 2026
- Las vías de pago como el pay-per-crawl de Cloudflare siguen en beta cerrada, y ningún gigante de la IA paga aún abiertamente por el estándar de licencias RSL
El tan comentado archivo llms.txt pertenece a la misma columna sobria: Ahrefs examinó 137.000 dominios en junio de 2026 y halló que el 97 % de los archivos nunca recibe una sola petición, y Google ha repetido que el buscador lo ignora.
¿Está tu web construida para agentes?
Los agentes que hacen gestiones por el usuario se volvieron cotidianos en 2026: Comet de Perplexity es gratuito y está en el iPhone, Claude hace clic y rellena formularios desde el navegador en todos los planes de pago, y Gemini de Google resuelve gestiones web con las sesiones del usuario. La guía de Google para sitios amigables con agentes es concreta: botones y enlaces reales en HTML semántico, maquetación estable y formularios con etiquetas correctas, porque los agentes leen el DOM, capturas de pantalla y el árbol de accesibilidad. Todo ello mejora el sitio también para las personas.
Preguntas frecuentes
- ¿Qué bots de IA dejo entrar si quiero clientes desde respuestas de IA?
- Los de índice de búsqueda y de usuario: OAI-SearchBot y ChatGPT-User para ChatGPT, Claude-SearchBot y Claude-User para Claude, PerplexityBot para Perplexity, más Googlebot y bingbot. Los bots de entrenamiento como GPTBot y ClaudeBot son una decisión aparte, desligada de la visibilidad.
- ¿Robots.txt frena de verdad a los bots de IA?
- Solo a los rastreadores declarados. Las peticiones activadas por un usuario suelen ignorar el archivo según la documentación de Google, OpenAI y Perplexity, y TollBit midió que el 30 % de las lecturas de IA pasó por encima de las reglas en el cuarto trimestre de 2025. Cerrar el paso al tráfico de verdad exige reglas de cortafuegos o de CDN.
- ¿Puede Cloudflare empezar a bloquear bots de IA por su cuenta?
- Sí. En dominios nuevos y sitios nuevos con publicidad, los bots de entrenamiento y de agentes quedan bloqueados por defecto desde el 15 de septiembre de 2026, mientras los bots de búsqueda pasan. Si tu web está detrás de Cloudflare, revisa la configuración para que el valor por defecto sea una elección tuya real.
- ¿Puedo cobrar a las empresas de IA por leer mi contenido?
- Las vías existen y el dinero es pequeño. El pay-per-crawl de Cloudflare sigue en beta cerrada, el estándar de licencias RSL suma infraestructura y editores mientras los gigantes de la IA se mantienen a la espera, y el reparto de ingresos de Perplexity cubre a los editores adheridos. Para la mayoría de empresas la visibilidad sigue siendo toda la compensación.
- ¿Cómo sé que un bot es quien dice ser?
- Compara el remitente con las listas de IP publicadas por las empresas, como los archivos JSON de OpenAI y Anthropic. El paso siguiente es la identificación criptográfica mediante Web Bot Auth, que Google prueba para sus agentes desde mayo de 2026 y Cloudflare ya usa para agentes firmados.
- ¿Aguanta mi web visitas de agentes de IA que hacen clic y rellenan formularios?
- Pruébalo tú: comprueba que el flujo principal se completa con teclado, que botones y enlaces usan elementos y etiquetas reales y que el contenido se queda quieto mientras la página carga. La guía de Google para sitios amigables con agentes coincide casi por completo con el trabajo de accesibilidad, así que el esfuerzo paga doble.
Fuentes
- OpenAI bots and crawlers — OpenAI developer docs
La documentación de GPTBot, OAI-SearchBot, ChatGPT-User y OAI-AdsBot, y la regla de que bloquear OAI-SearchBot saca el sitio de las respuestas de búsqueda de ChatGPT.
- Does Anthropic crawl data from the web? — Anthropic Help Center
La división en tres de Anthropic en ClaudeBot, Claude-SearchBot y Claude-User, con control por robots.txt y listas de IP.
- Google user-triggered fetchers — Google Crawling Infrastructure
Google-Agent y la indicación de que las peticiones activadas por el usuario suelen ignorar robots.txt, actualizada el 19 de agosto de 2026.
- Perplexity crawlers — Perplexity docs
PerplexityBot para el índice de búsqueda, y Perplexity-User ignorando por lo general robots.txt en peticiones de usuario.
- Your site, your rules: new AI traffic options — Cloudflare
Las categorías de búsqueda, agente y entrenamiento, y los bloqueos por defecto que llegan el 15 de septiembre de 2026.
- AI licensing deals, protection measures aren’t slowing web scraping — Digiday
La medición de TollBit: el 30 % de las lecturas de IA esquivó robots.txt en el cuarto trimestre de 2025, el 42 % en ChatGPT-User.
- We Analyzed 137K Sites: 97% of llms.txt Files Never Get Read — Ahrefs
El estudio de junio de 2026 sobre 137.210 dominios donde el 97 % de los archivos llms.txt nunca recibió una petición.
- Build agent-friendly websites — web.dev
La guía de Google para sitios amigables con agentes: HTML semántico, maquetación estable y agentes que leen el DOM, capturas y el árbol de accesibilidad.
Cuéntanos qué quieres construir
Treinta minutos, sin coste, y una respuesta directa sobre si somos el estudio adecuado.