Qué fuentes vuelve a utilizar la IA al repetir el mismo prompt
Una cohorte congelada de Bee LLM muestra que la reutilización de fuentes varía de forma material entre motores y que las respuestas siguen recurriendo a un conjunto cambiante de hosts.
Los motores de IA sí reutilizan una parte de las fuentes registradas cuando se ejecuta varias veces el mismo prompt, pero el grado de recurrencia cambia de forma notable entre motores. En la cohorte elegible de Bee LLM, la proporción media —dando el mismo peso a cada prompt— de hosts únicos que aparecieron en dos o más respuestas fue del 51,8% en ChatGPT, el 67,5% en Gemini, el 57,9% en Perplexity, el 75,9% en Claude y el 39,5% en Google AI Mode.
Estos porcentajes no significan que el usuario viera las mismas citas en todas las ejecuciones. La unidad medida es un host normalizado presente en la telemetría de fuentes registradas. El estudio aporta evidencia sobre la recurrencia del conjunto recogido, pero no demuestra que cada host se mostrara como cita, se consultara del mismo modo o sustentara una afirmación concreta.
El resultado, de un vistazo
| Motor | Respuestas elegibles | Prompts elegibles | Media de hosts únicos reutilizados |
|---|---|---|---|
| ChatGPT | 1.014 | 65 | 51,8% |
| Gemini | 586 | 51 | 67,5% |
| Perplexity | 550 | 45 | 57,9% |
| Claude | 191 | 31 | 75,9% |
| Google AI Mode | 102 | 16 | 39,5% |
Cada valor es una media de resultados calculados primero dentro de cada prompt. No es un porcentaje obtenido al mezclar todas las respuestas. La diferencia es importante porque la cohorte contiene más observaciones de ChatGPT que de AI Mode y algunos prompts se ejecutaron más veces que otros.
Qué pregunta responde el estudio
La pregunta de investigación es deliberadamente estrecha: si un prompt idéntico se repite en el mismo motor, ¿qué parte de los hosts de fuentes registrados vuelve a aparecer en más de una respuesta? Los equipos de visibilidad suelen observar una fuente una vez y asumir que forma parte estable del paisaje del motor. El análisis comprueba hasta qué punto esa suposición se sostiene a nivel de host.
No estudia si un dominio es más fiable, si una página provocó que el modelo escribiera una frase ni si el sistema de recuperación de un motor es mejor. Las integraciones de los proveedores exponen objetos de fuente diferentes y el trabajo no equipara una URL registrada con una atribución visible. Acotar la pregunta evita convertir un estudio de telemetría operativa en una afirmación no sustentada sobre rankings.
La cohorte congelada
El corte se congeló el 21 de julio de 2026 a las 18:00 UTC. La cohorte general de producción, excluida la demo, contenía 5.313 respuestas procedentes de 1.416 ejecuciones completadas, 75 prompts, ocho cuentas y 11 proyectos. Después se aplicaron reglas de elegibilidad más estrictas por motor para calcular la recurrencia.
Se descartaron las cuentas demo, las ejecuciones incompletas, las respuestas vacías o con error y los registros sin al menos un host HTTP o HTTPS convertible. Una celda formada por prompt y motor debía contar con cinco respuestas válidas con fuentes. El resultado fue de 1.014 respuestas de ChatGPT en 65 prompts, 586 de Gemini en 51, 550 de Perplexity en 45, 191 de Claude en 31 y 102 de AI Mode en 16.
Todos los cortes públicos superaron los mínimos de diez ejecuciones, cinco prompts, tres proyectos y tres cuentas. El artefacto agregado no contiene nombres de clientes, marcas, proyectos, prompts ni dominios. Los identificadores y textos permanecieron únicamente en memoria remota durante la extracción de solo lectura.
Cómo se definió la reutilización
Las URL se convirtieron en hosts en minúsculas, se eliminó el prefijo habitual www., se descartaron wrappers internos conocidos y cada host se contó una sola vez dentro de una respuesta. Para cada combinación de prompt y motor se formó primero la unión de todos los hosts únicos. Un host se consideró reutilizado si aparecía en al menos dos respuestas elegibles.
La métrica principal divide los hosts únicos reutilizados entre todos los hosts únicos de esa celda. Imaginemos cinco respuestas elegibles que reúnen 20 hosts distintos. Si ocho aparecen en dos o más respuestas, la recurrencia es 8 dividido entre 20: un 40%. Para esta métrica no importa si un host recurrente aparece dos veces o en las cinco respuestas.
El artefacto incluye dos medidas de sensibilidad. La proporción de incidencias recurrentes calcula qué parte de todas las observaciones respuesta-host procede de hosts reutilizados, de modo que las fuentes que regresan muchas veces ganan peso. El Jaccard medio por pares compara el conjunto de hosts de cada pareja de respuestas. Ambas ayudan a interpretar el dato principal, pero la proporción de hosts únicos recurrentes es la respuesta más directa a la pregunta planteada.
Por qué cada prompt tiene el mismo peso
Un cálculo bruto daría más influencia a los prompts con mayor frecuencia. Si uno contara con cien respuestas y otro con cinco, el primero podría dominar el resultado del motor aunque ambos representaran preguntas de cliente igualmente importantes. Por eso el estudio calcula primero las métricas dentro de cada prompt y promedia después.
Esta decisión determina el significado del porcentaje. El 51,8% de ChatGPT describe el patrón medio de los 65 prompts elegibles bajo una ponderación equitativa. No es el porcentaje de todas las filas de hosts de ChatGPT que se repitieron. Para un equipo de contenido o medición, esta opción suele ser más útil porque conserva el inventario de prompts diseñado como marco analítico, en lugar del volumen accidental de ejecuciones.
Cómo interpretar las diferencias entre motores
Claude mostró la media más alta en esta cohorte, un 75,9%, y AI Mode la más baja, un 39,5%. Gemini y Perplexity quedaron entre ambos, mientras que ChatGPT se situó cerca de la mitad. Son diferencias descriptivas bajo las integraciones y filtros observados; no constituyen una clasificación de calidad.
Los tamaños elegibles tampoco son iguales. Claude se basa en 31 prompts y AI Mode en 16, frente a los 65 de ChatGPT. Además, la telemetría de fuentes tiene significados distintos según el proveedor. Un host capturado por una integración puede representar una fase o una condición de presentación diferente a la de otro sistema. La lectura segura es que el patrón operativo de recurrencia varió entre motores en esta cohorte, no que un motor utilice siempre menos fuentes o fuentes mejores.
También existe variación dentro de cada motor. En ChatGPT, las proporciones por prompt oscilaron entre el 22,9% y el 71,9%, con una mediana del 51,4%. Gemini fue del 36,0% al 95,0% y Perplexity del 33,3% al 83,3%. Una media general no sustituye el diagnóstico por pregunta. La categoría, la redacción, el momento y los resultados disponibles pueden acompañar conjuntos de fuentes distintos.
Qué implica para la medición de visibilidad
Una lista obtenida en una sola ejecución es evidencia incompleta. Incluso en el motor con mayor recurrencia agregada hubo hosts que no regresaron. Un equipo que recoge una única respuesta puede confundir una fuente transitoria con una fuente estable o no observar otra que aparece en ejecuciones posteriores. Es el mismo problema de muestreo que afecta a menciones, posiciones y redacción de las respuestas.
La recogida repetida debe conservar observaciones atómicas antes de agregarlas: prompt exacto, motor, idioma, momento, estado válido o fallido, hosts registrados y citas visibles cuando la integración las exponga. Un sistema de seguimiento no debería mezclar URL detectadas y citas explícitas en un único campo. Separarlas permite estudiar descubrimiento de fuentes sin afirmar atribución visible.
La guía de métricas y KPIs de visibilidad en IA ayuda a encajar esta medida en un cuadro de mando más amplio. Si la decisión se centra en presencia de marca, el proceso para monitorizar menciones en buscadores de IA explica alias, muestreo de prompts y repeticiones.
Un flujo práctico para medir recurrencia
- Congela el inventario de prompts. Separa preguntas de categoría, problema y comparación para que un cambio de mezcla no parezca un cambio de comportamiento.
- Repite con condiciones documentadas. Registra motor, idioma, modo, ubicación y momento. No unas superficies incompatibles sin etiquetarlas.
- Conserva los estados ausentes. Una respuesta fallida o sin telemetría no es un conjunto vacío de fuentes y no puede convertirse en recurrencia cero.
- Normaliza de forma conservadora. Deduplica hosts dentro de cada respuesta y documenta la retirada de prefijos o wrappers. No unas subdominios distintos sin una regla.
- Calcula primero por prompt. Examina recurrencia, incidencias y solapamiento por pares antes de producir un resumen de motor.
- Revisa ejemplos bajo control de acceso. Los agregados señalan anomalías; las personas autorizadas pueden inspeccionar después ejemplos a nivel de fuente con las salvaguardas adecuadas.
Este flujo convierte los cambios en algo auditable. Si la recurrencia cae después de una actualización, el equipo podrá distinguir un cambio de respuestas de una modificación del conjunto de prompts, un fallo de recogida o una redefinición de la telemetría.
Qué no puede demostrar este trabajo
La muestra no es un censo de todos los usuarios, sectores o preguntas. Incluye proyectos no demo de Bee LLM que cumplían los requisitos en la fecha de corte. La ponderación por prompt reduce el sesgo por frecuencia dentro de la cohorte, pero no convierte esa cohorte en un panel representativo del mercado.
El análisis trabaja a nivel de host. Dos páginas distintas del mismo host se tratan como una misma fuente, mientras que subdominios relacionados pueden seguir separados. No permite saber si cambió el contenido de una página ni si el mismo fragmento sustentó una respuesta. Tampoco mide calidad, audiencia, tráfico referido ni influencia causal sobre una recomendación.
La limitación esencial es que la telemetría de fuentes registradas no equivale automáticamente a telemetría de citas visibles. En este artículo, “fuente reutilizada” significa un host normalizado reutilizado dentro del campo de fuentes registrado y elegible. Cualquier afirmación sobre visibilidad de citas exige un mapa explícito de atribuciones y otro denominador.
Reproducibilidad e integridad
La extracción se ejecutó sobre PostgreSQL de producción de Bee LLM en una transacción repetible y de solo lectura. El agregado, la metodología, la exportación tabular y el wrapper de análisis quedaron congelados con hashes. El agregado asociado a este artículo tiene el SHA-256 dac3a0a862b513789744b34e2879c4bc847fcc3dfd989505f40420aa0468e354. Cualquier edición o recálculo alteraría el digest y haría fallar el control editorial de evidencia.
El valor principal no es un porcentaje universal, sino la necesidad demostrada de tratar las fuentes como observaciones repetidas. En esta cohorte todos los motores reutilizaron una parte de sus hosts registrados y todos introdujeron también fuentes que no persistieron en todas las ejecuciones. Un programa de visibilidad defendible debe medir recurrencia y cambio, no tratar una única respuesta generada como evidencia permanente.
Preguntas frecuentes
¿Un host registrado significa que el usuario vio una cita?
No necesariamente. El estudio utiliza hosts guardados en la telemetría de fuentes detectadas. Un host registrado puede no coincidir con una cita atribuida de forma visible, por lo que el resultado mide recurrencia de fuentes y no recurrencia de citas visibles.
¿Por qué todos los prompts reciben el mismo peso?
Algunos prompts tenían muchas más respuestas elegibles que otros. Dar el mismo peso a cada prompt evita que un pequeño grupo ejecutado con mucha frecuencia domine el resultado agregado de un motor.
¿Estos porcentajes predicen lo que verá una marca concreta?
No. Describen la cohorte elegible de Bee LLM hasta el 21 de julio de 2026. Una marca, un mercado, un prompt o una versión futura del motor pueden mostrar otro patrón; cada equipo debe medir su propia muestra repetida.
