Saltar al contenido
Estudio original

Con qué frecuencia ChatGPT y Gemini citan los mismos dominios

En respuestas emparejadas con telemetría explícita de citas en ambos motores, la mayoría no compartió ningún host; la definición de fuente cambió mucho el resultado.

9 min de lectura

ChatGPT y Gemini registraron con frecuencia hosts de cita explícita distintos para el mismo prompt dentro de la misma ejecución. De 337 ejecuciones emparejadas elegibles, 204 pares —el 60,5%— no compartieron ningún host de cita. Al calcular la tasa dentro de cada prompt y dar el mismo peso a los 71 prompts, la media sin solapamiento fue del 61,4%.

El resultado es condicional. Las dos respuestas debían contener un mapa explícito de citas no vacío, por lo que no representa ejecuciones sin esa telemetría. Además, cambia de forma material al modificar la definición de fuente: con el campo más amplio de URL detectadas, el 31,2% de los pares no compartió host. Las citas explícitas y las fuentes detectadas están relacionadas, pero no son el mismo objeto analítico.

Resultado del análisis emparejado

MedidaHosts de cita explícitaURL detectadas
Ejecuciones emparejadas337337
Pares sin ningún host compartido204105
Tasa sin solapamiento por par60,5%31,2%
Jaccard mediano por par00,0357

El rango intercuartílico del Jaccard para citas explícitas fue de 0 a 0,0833. Un valor cero significa que los dos conjuntos de hosts normalizados no tienen ningún elemento en común; un valor uno indicaría conjuntos idénticos. La mediana baja describe poco solapamiento, no la corrección ni la utilidad de las respuestas.

Qué comparó exactamente el estudio

El diseño emparejó una respuesta válida de ChatGPT con una respuesta válida de Gemini producidas para el mismo prompt y la misma ejecución. Comparar dentro de una ejecución mantiene unidos el prompt almacenado y su contexto mejor que enfrentar respuestas independientes de días distintos. El análisis extrajo solo los hosts enlazados a fragmentos mediante el cite_map explícito de cada motor, los normalizó y eliminó duplicados dentro de cada respuesta.

Para cada par se calculó la intersección y la unión de ambos conjuntos. El índice de Jaccard es el tamaño de la intersección dividido entre el tamaño de la unión. También se registró si la intersección estaba vacía. Como algunos prompts tenían más ejecuciones emparejadas, la tasa principal se calculó primero dentro de cada prompt y se promedió después.

El diseño responde a una pregunta precisa: bajo las condiciones de telemetría elegibles, ¿con qué frecuencia ChatGPT y Gemini expusieron al menos un mismo host de cita para prompts emparejados? No determina qué sistema encontró antes una fuente, si el host influyó en la generación ni si la cita recibió la misma prominencia.

Elegibilidad y ventana congelada

La evidencia quedó congelada el 21 de julio de 2026 a las 18:00 UTC. Los pares elegibles abarcan desde el 13 de julio a las 07:45:45 UTC hasta el 21 de julio a las 15:50:03 UTC. El conjunto final contiene 337 ejecuciones, 71 prompts, 11 proyectos y ocho cuentas.

Se excluyeron cuentas demo, ejecuciones incompletas, respuestas vacías o con error y cualquier par en el que uno de los motores careciera de un mapa explícito de citas no vacío. La ausencia de ese mapa es telemetría faltante para este análisis, no evidencia de cero citas. Convertir esos casos en conjuntos vacíos inflaría la tasa sin solapamiento y respondería otra pregunta.

La cohorte superó los umbrales públicos predefinidos de cuentas, proyectos, prompts y ejecuciones. La extracción se realizó mediante una transacción repetible y de solo lectura. El agregado congelado no contiene texto de prompts, hosts, marcas, proyectos ni identificadores de cuenta.

Por qué el dato ponderado por prompt es el principal

El 60,5% bruto da el mismo peso a los 337 pares. Es una descripción válida a nivel de ejecución, pero concede más influencia a los prompts con más repeticiones. El titular del 61,4% calcula por separado la proporción sin solapamiento de cada prompt y promedia luego los 71 resultados.

Ambos porcentajes son próximos en esta cohorte, algo tranquilizador, pero el método por prompt sigue siendo el principal. Un inventario de seguimiento representa un conjunto de preguntas; no debería convertirse en una lotería donde la pregunta más ejecutada defina todo el programa. La agrupación implica además que los 337 pares no equivalen a 337 temas completamente independientes.

Entre prompts, la tasa sin solapamiento fue desde el 0% hasta el 100%, con una mediana del 66,7% y un rango intercuartílico del 33,3% al 100%. La dispersión importa para operar. Algunas preguntas produjeron más hosts comunes y otras separaron repetidamente los conjuntos de citas de ambos motores.

Por qué la definición de fuente cambia la respuesta

La sensibilidad amplia usó detected_urls en vez de hosts enlazados explícitamente a fragmentos. Bajo ese objeto, 105 de los 337 pares no presentaron solapamiento, un 31,2%, y el Jaccard mediano subió de cero a 0,0357. La diferencia es demasiado grande para esconderla en una nota al pie.

Una URL detectada puede reflejar descubrimiento de fuentes o telemetría del proveedor que no se presenta como atribución explícita en la respuesta. Un mapa de citas conecta un host con un fragmento dentro de la estructura registrada. Ninguno es automáticamente “mejor”; responden a preguntas distintas. Si un panel los mezcla, puede parecer que el solapamiento de citas aumentó sin que cambie la atribución visible.

Los equipos deben nombrar el campo en cada gráfico. “Solapamiento de hosts citados” debería reservarse para telemetría de atribución explícita. “Solapamiento de fuentes detectadas” puede describir el conjunto amplio. Si un motor deja de ofrecer uno de esos campos, la serie debe marcarse como no disponible en lugar de sustituirse silenciosamente.

Qué implica —y qué no— un solapamiento bajo

Un solapamiento limitado indica que la visibilidad de fuentes entre motores no es intercambiable en esta muestra. Observar un dominio en ChatGPT no permite asumir que aparecerá en Gemini para la misma pregunta, incluso cuando ambos registran citas explícitas. Un programa que mida un único motor puede dejar fuera una parte importante del paisaje de atribución de otro.

No significa que una respuesta sea incorrecta. Dos motores pueden sostener conclusiones compatibles con fuentes diferentes. Del mismo modo, compartir un host no prueba el mismo razonamiento, prominencia, interpretación ni experiencia. La métrica no mide autoridad, vigencia de página, sentimiento, completitud ni valor de conversión.

Tampoco demuestra preferencias permanentes. La ventana apenas supera ocho días y el resultado describe la cohorte elegible de Bee LLM. Los resultados de búsqueda, el comportamiento del modelo, las interfaces y la web pueden cambiar. Una afirmación longitudinal exige paneles congelados repetidos bajo condiciones comparables.

Implicaciones para marcas y equipos de contenido

Primero, hay que medir cada motor por separado. Un total único de “citas de IA” puede ocultar que superficies diferentes muestran dominios distintos para el mismo prompt. Antes de agregar, deben conservarse motor, prompt, idioma, momento, tipo de fuente y estado de la ejecución.

Segundo, hay que separar presencia y atribución. Una marca puede aparecer sin una cita de su dominio y una página puede ser citada sin que la marca se convierta en recomendación. El marco de métricas y KPIs de visibilidad en IA mantiene independientes ambas dimensiones.

Tercero, conviene repetir la muestra. Este trabajo compara motores dentro de una ejecución emparejada, pero un par sigue siendo una sola observación. Repetir revela si un host es recurrente o transitorio. La guía para monitorizar menciones de marca aplica la misma disciplina a la presencia.

Por último, hay que investigar las brechas en lugar de perseguir todos los dominios. Si una pregunta importante muestra referencias de categoría en un motor y no en otro, se puede revisar si falta documentación, evidencia independiente o consistencia de entidad, o si la diferencia es solo de telemetría. La observación inicia un diagnóstico; no produce una receta automática.

Flujo reproducible para medir solapamiento

  1. Define una clave emparejada. Usa el mismo prompt y contexto; rechaza uniones ambiguas.
  2. Separa los objetos de fuente. Guarda citas explícitas y URL detectadas en campos distintos.
  3. Normaliza a nivel de host. Pasa a minúsculas, retira prefijos documentados y deduplica por respuesta.
  4. Mantén ausente lo que falta. No conviertas un mapa inexistente en conjunto vacío.
  5. Calcula por pares. Registra intersección, unión, Jaccard y estado sin solapamiento.
  6. Agrega dentro de cada prompt. Haz que cada pregunta contribuya con el mismo peso al resumen.
  7. Publica denominadores y sensibilidad. El lector necesita saber cuánto cambia el resultado con una definición más amplia.

La secuencia hace auditable el cálculo y evita que el volumen de un proveedor decida el resultado. También aísla futuros cambios de integración: si desaparece el mapa explícito, la métrica queda no disponible en vez de romper la continuidad de manera invisible.

Limitaciones

El análisis está condicionado a mapas explícitos no vacíos en ambos motores. No estima el solapamiento de los pares excluidos. Los motores pueden exponer la atribución de manera distinta y un fragmento enlazado estructuralmente no garantiza que todas las interfaces mostraran la cita igual a todos los usuarios.

El host es una unidad gruesa. Varias páginas de un dominio se agrupan, mientras que subdominios relacionados pueden seguir separados. El estudio no evalúa coincidencia a nivel de página, sustento de frases, calidad de fuente ni contribución causal. Tampoco publica dominios, de modo que no identifica qué categorías explican la diferencia.

La muestra no es un panel representativo del mercado. Es un agregado de observaciones elegibles de producción de Bee LLM hasta un corte fijo. La ponderación por prompt controla una forma de sesgo de volumen, pero no elimina la selección de proyectos y preguntas de origen.

Integridad de la evidencia

El agregado congelado asociado al artículo tiene SHA-256 5805e41a5dfc0158a67bb82b86128c7d3d469b0a1e834e94599aa1b6a7511cb2. La metodología, el CSV, el wrapper y el JSON se almacenan con sumas de verificación, y la extracción puede repetirse mediante el script común de solo lectura.

La conclusión defendible es concreta: en 337 ejecuciones emparejadas con telemetría explícita en ambos motores, ChatGPT y Gemini no compartieron con frecuencia ningún host, y la tasa media por prompt fue del 61,4%. El 31,2% obtenido con URL detectadas demuestra por qué todo análisis de citas debe declarar con exactitud qué objeto de fuente está midiendo.

Preguntas frecuentes

¿El 61,4% de todas las respuestas de ChatGPT y Gemini no comparte citas?

No. La media del 61,4%, ponderada por prompt, solo se aplica a ejecuciones emparejadas en las que ambos motores registraron un mapa de citas explícito y no vacío. No representa respuestas sin esa telemetría ni a todos los usuarios.

¿Por qué el resultado con URL detectadas es distinto?

Las URL detectadas forman un objeto de fuente más amplio que los hosts enlazados explícitamente a fragmentos. En la sensibilidad, el 31,2% de los pares no tuvo solapamiento, frente al 60,5% por par para hosts de cita explícita.

¿Un solapamiento bajo indica fuentes de peor calidad?

No. El solapamiento mide hosts compartidos, no calidad, corrección ni influencia causal. Dos respuestas correctas pueden citar dominios distintos y dos respuestas con el mismo dominio no tienen por qué ofrecer la misma calidad.