Saltar al contenido

¿Qué webs permiten el rastreo de la IA? Analizamos 5.381 dominios

Casa Blanca, NASA, medios y miles de dominios de los rankings de Semrush. Consulta quién declara permisos de rastreo y qué devolvió cada prueba.

·

Actualización de permisos tras reintentos

7 de septiembre de 2026 (Madrid). Repetimos la lectura de los archivos robots.txt que no se habían podido interpretar en 1.746 dominios de la muestra. Consultamos hasta tres veces adicionales cada archivo pendiente, con 18 segundos de plazo por petición y pausas entre tandas. Dejamos de repetirlo en cuanto pudimos interpretarlo.

Se realizaron 6.307 peticiones adicionales a 2.275 URLs de archivos. Pudimos confirmar todos los permisos de búsqueda pendientes en 257 dominios.

Clasificación por permisos de búsqueda. Base: 5.381 dominios, una categoría por dominio.
PermisosAntesTras reintentos
Permiten los servicios de búsqueda analizados3.3003.539 (65,8 %)
Restringen al menos uno338356 (6,6 %)
No se pudo comprobar1.7431.486 (27,6 %)

La clasificación considera OAI-SearchBot, Claude-SearchBot y PerplexityBot. Si aparece alguna restricción, el dominio entra en ese grupo, aunque otro permiso siga sin confirmar. Si no hay restricciones y conocemos todos los permisos, entra en «Permiten». Los demás quedan en «No se pudo comprobar».

Esta actualización revisa permisos para las rutas observadas originalmente, no repite las pruebas HTTP de acceso. Los 2.368 dominios que permitieron y respondieron (44 %) conservan la prueba original. La tabla buscable y las cifras de la primera ronda que siguen debajo se mantienen como registro de aquella comprobación. Persisten rechazos del servidor, tiempos agotados y otros fallos de lectura; no se convierten en bloqueos declarados.

Descargar el resumen de los reintentos (JSON)

Primera ronda: resultados originales

338 de los 5.381 dominios analizados (6,3 %) declaran una restricción para al menos uno de los tres bots principales de búsqueda que comprobamos: OAI-SearchBot, Claude-SearchBot y PerplexityBot. La restricción afecta a la URL de entrada o a un destino de su redirección.

En 2.368 dominios (44,0 %), los tres tienen permiso y recibieron respuesta en nuestras pruebas. En otros casos encontramos rechazos, retos antibot o evidencia insuficiente. Una prueba con el user-agent de un bot no acredita el acceso desde su IP oficial.

En 1.746 dominios (32,4 %), no pudimos confirmar los permisos de al menos uno de esos tres bots. Estos casos siguen dentro de la muestra y no se cuentan como permisos. Esta cifra puede coincidir con restricciones conocidas de otro bot en el mismo dominio.

La muestra principal reúne los 3.000 primeros dominios de Semrush Rank de España y los 3.000 de Estados Unidos del 5 de septiembre de 2026. Al eliminar los 619 dominios compartidos quedan 5.381. Los seis casos editoriales adicionales se muestran aparte y no entran en estos porcentajes.

Los permisos cambian según el bot y su función

En la muestra, 385 dominios restringen GPTBot y permiten OAI-SearchBot. Son permisos para usos diferentes: GPTBot recopila contenido para entrenamiento y OAI-SearchBot sirve a la búsqueda de ChatGPT. OpenAI documenta ambos controles por separado.

Permisos declarados en las rutas comprobadas. Base: 5.381 dominios.
AgentePermitidoRestringidoSin confirmar
OAI-SearchBot3.463177 (3,3 %)1.741
GPTBot3.080566 (10,5 %)1.735
Claude-SearchBot3.447192 (3,6 %)1.742
ClaudeBot3.100543 (10,1 %)1.738
PerplexityBot3.318320 (5,9 %)1.743
CCBot3.007637 (11,8 %)1.737

«Restringido» significa que encontramos una regla aplicable a la URL de entrada o a alguno de sus destinos. No implica que todo el dominio esté cerrado. «Sin confirmar» permanece dentro del denominador; no lo tratamos como un permiso ni como un bloqueo.

La misma separación existe entre ClaudeBot, Claude-SearchBot y Claude-User. Una política sobre entrenamiento no describe por sí sola la política de búsqueda o de visitas solicitadas por una persona. Funciones de los agentes de Anthropic.

España y Estados Unidos: dos rankings, con dominios compartidos

El filtro de mercado indica en qué ranking aparece un dominio, no dónde está su propietario. Estas cifras permiten explorar las dos selecciones sin atribuir las diferencias a una causa nacional.

SelecciónDominiosRestricción en algún bot de búsquedaProporción
Ranking España3.0001695,6 %
Ranking EE. UU.3.0002297,6 %

Ambas selecciones comparten 619 dominios y no son muestras independientes. Semrush Rank mide visibilidad orgánica estimada; estos archivos no contienen Authority Score ni representan un ranking mundial de autoridad. Definición de Semrush Rank.

Las webs que despiertan más curiosidad

Estos casos ayudan a leer los resultados. Una institución puede declarar permisos y, al mismo tiempo, responder de forma distinta a determinadas peticiones.

Casa Blanca

Los tres bots principales de búsqueda tienen permiso y recibieron respuesta en esta prueba.

Ver whitehouse.gov

NASA

La evidencia no permite confirmar el acceso de los tres bots principales de búsqueda.

Ver nasa.gov

Casa Real española

La evidencia no permite confirmar el acceso de los tres bots principales de búsqueda.

Ver casareal.es

CIA

Algunas peticiones de prueba recibieron un rechazo o un reto. Esto no demuestra un bloqueo del bot oficial.

Ver cia.gov

Vaticano

Los tres bots principales de búsqueda tienen permiso y recibieron respuesta en esta prueba.

Ver vatican.va

Pentágono (dominio defense.gov)

La evidencia no permite confirmar el acceso de los tres bots principales de búsqueda.

Ver defense.gov

Busca y compara los dominios

Elige un rastreador para ver sus permisos y respuestas. Pulsa un dominio para consultar las reglas, los destinos de las redirecciones y la evidencia de todos sus agentes.

Cargando dominios…

Cargando los datos del estudio…

Permisos y respuestas de OAI-SearchBot
Dominio e instituciónSemáforo de la pruebaRank ESRank USPermiso declaradoPrueba desde Bee LLMComprobado (Madrid)

En pantallas estrechas puedes desplazar la tabla horizontalmente. Verde: permiso y respuesta observada. Rojo: restricción declarada. Ámbar: rechazo o reto en nuestra prueba. Gris: sin confirmación o evaluación solo de robots.txt. Los guiones en los rankings indican que el dominio no aparece en ese archivo. Ningún color acredita visitas oficiales ni citas.

Cómo hicimos las comprobaciones

Comprobaciones entre 2026-09-06 21:14 y 2026-09-06 21:52 UTC, desde un servidor de Bee LLM. Para cada dominio solicitamos la portada mediante HTTPS, leímos robots.txt y evaluamos sus reglas para las rutas de entrada y las redirecciones observadas. No rastreamos todas las páginas internas.

El catálogo contiene 17 agentes o tokens. Para 12 enviamos peticiones con su user-agent, de una en una dentro de cada análisis, con una petición de referencia de navegador y un agente neutral de control. Googlebot, Bingbot, Applebot, Google-Extended y Applebot-Extended se evaluaron solo mediante robots.txt. Los dos últimos son tokens de control, no identidades con las que se envían peticiones.

El presupuesto de tiempo por dominio fue de 45 segundos, con un plazo de hasta 8 segundos por petición. No iniciamos sesión, resolvimos captchas ni reprodujimos las IP oficiales de los proveedores. Conservamos tiempos, códigos HTTP, reglas y huellas de los archivos consultados. «Respuesta recibida» significa que nuestra petición obtuvo una respuesta satisfactoria sin un reto reconocido; no acredita que todo el contenido sea utilizable.

Los fallos, límites y respuestas inciertas permanecen visibles. Los porcentajes se calculan sobre los 5.381 dominios de la muestra principal, sin excluir los casos sin confirmar. Los 6 adicionales no modifican esos porcentajes. Las redirecciones pueden hacer que varios dominios acaben en la misma web: la unidad de este estudio sigue siendo el dominio incluido en el ranking.

Las pruebas se ejecutan desde una sola conexión y en un momento concreto. El sitio puede responder de otra forma por IP, ubicación, verificación del bot o cambios posteriores. Esta muestra no permite inferir qué porcentaje de toda la web bloquea IA, ni medir visitas reales o efectos sobre las citas.

Qué comprobar en tu propia web

Busca primero el bot que corresponde a tu objetivo: búsqueda, entrenamiento o visitas solicitadas por usuarios. Revisa la regla concreta si robots.txt restringe una ruta. Si la petición recibe un rechazo o un reto, contrasta ese resultado con los registros de tu servidor y con la configuración de tus controles antibot.

Si tu dominio no aparece en la tabla, o has cambiado su configuración desde la fecha del estudio, utiliza el analizador para obtener una observación nueva. GEO Check permite repetir la comprobación desde tu navegador; la conexión puede cambiar el resultado.

Evidencia del dominio