Saltar al contenido
Seguridad IA

Cuando la información falsa entra en la memoria de una IA

Un atacante no siempre necesita comprometer el modelo. Manipular las evidencias que recupera puede bastar para cambiar su conclusión.

·11 min de lectura·GEO defensivo

Manipular una respuesta de inteligencia artificial no siempre requiere atacar directamente al modelo. Si un asistente o verificador utiliza búsquedas web o un sistema de generación aumentada por recuperación, el atacante puede actuar sobre la capa de evidencias: publicar o inyectar materiales fáciles de recuperar, aparentemente creíbles y preparados para respaldar una conclusión falsa.

El preprint GPE, publicado en julio de 2026, prueba este riesgo en condiciones controladas. A lo largo de 638 afirmaciones, todos los métodos de verificación evaluados perdieron fiabilidad a medida que las evidencias limpias se sustituían por contenidos contaminados. Ningún método fue robusto frente a los cuatro ataques y el más dañino conservaba el estilo de fuentes reales mientras alteraba datos decisivos como entidades, cantidades, fechas y relaciones causales.

El riesgo central

Una IA puede confundir varias páginas con confirmaciones independientes aunque repitan, deriven de o formen parte de una misma campaña. El volumen de evidencias no equivale a calidad ni independencia.

Un ejemplo sencillo: el precio equivocado se repite

Imaginemos que una empresa vende un software por 49 € al mes. Varias comparativas, directorios y artículos empiezan a afirmar que cuesta 99 €. Cuando una IA recupera varias de esas páginas, la cantidad incorrecta puede parecer respaldada por fuentes diferentes y terminar en su respuesta.

Este ejemplo es ilustrativo; no es un incidente documentado en GPE. El mismo mecanismo podría dirigirse contra afirmaciones más graves: la salud financiera de una empresa, la seguridad de un producto, la identidad de un directivo, una acusación de fraude o una cantidad médica. GPE modela explícitamente ataques que cambian personas, organizaciones, fechas, valores monetarios, relaciones causales y dosis de medicamentos mientras conservan un lenguaje parecido al de la fuente original.

La repetición vuelve peligroso el ataque porque muchos sistemas de recuperación optimizan relevancia, no verdad. Un pasaje falso muy pertinente puede superar a una fuente fiable peor optimizada. Varias copias también pueden crear una apariencia de consenso si el sistema no detecta su origen común.

Qué significa contaminación GEO

La optimización para motores generativos, o GEO, busca que un contenido resulte más fácil de recuperar, resumir y citar por los buscadores de IA. En una estrategia legítima implica publicar información clara, bien documentada y legible por máquinas. La contaminación GEO aplica mecánicas parecidas de visibilidad a evidencias engañosas.

Los autores de GPE describen el riesgo como la publicación deliberada de grandes cantidades de contenido optimizado alrededor de una afirmación o entidad para aumentar la probabilidad de que la evidencia contaminada entre en el razonamiento. El verificador recibe entonces una mezcla: algunos documentos pueden ser actuales e independientes; otros, copiados, desactualizados, alterados o inventados.

Este fenómeno está relacionado con una alucinación, pero no es lo mismo. Una alucinación puede aparecer sin ningún documento externo falso. La contaminación GEO modifica el entorno informativo utilizado para fundamentar la respuesta. El resultado puede citar materiales aparentemente pertinentes y seguir siendo incorrecto.

Por qué RAG crea una nueva superficie de ataque

La generación aumentada por recuperación, o RAG, combina el conocimiento paramétrico del modelo con documentos externos. Un recuperador localiza fragmentos relacionados con la pregunta y el modelo los utiliza como contexto. Esto aporta información más reciente y facilita el respaldo con fuentes, pero traslada parte de la fiabilidad a la colección documental y a la política de recuperación.

Si una base de conocimiento, un índice vectorial o un resultado de búsqueda contiene evidencias manipuladas, el sistema puede recuperar el mismo error una y otra vez. La página contaminada deja de ser un contenido aislado y pasa a alimentar un proceso automatizado de decisión.

El riesgo aumenta cuando las copias derivadas persisten en índices, cachés, bases vectoriales, repositorios documentales u otras capas. Eliminar la página original no garantiza que todas sus representaciones desaparezcan al mismo tiempo. Por eso conviene entender cómo eligen fuentes los LLM y conservar la procedencia durante la ingestión y la indexación.

Qué evaluó el benchmark GPE

Un entorno de evidencias controlado

GPE contiene 638 afirmaciones verificadas por personas sobre política, celebridades, ciencia, medicina y salud, historia y conocimientos cotidianos. Su registro conecta esas afirmaciones con 11.313 evidencias, 4.120 fuentes editoriales, 22.611 entidades normalizadas y 789 eventos canónicos.

En cada evaluación, el sistema recibía tres evidencias pertinentes. Los niveles del 0%, 33%, 67% y 100% sustituían cero, una, dos o las tres evidencias limpias. La afirmación y su etiqueta verificada permanecían iguales, de modo que los cambios podían atribuirse a la contaminación.

El estudio utilizó como modelos base DeepSeek-V4-Flash y GPT-5.4, y comparó cuatro estrategias: una decisión directa del modelo, RAFTS, SAFE y STEEL. Probó cuatro familias de ataques:

Resultados: acertar con datos limpios no garantiza robustez

La verificación ya resultó difícil sin ataques. La mejor exactitud en las seis etiquetas fue del 52,7% con DeepSeek-V4-Flash y del 53,9% con GPT-5.4. Cuando entraron evidencias contaminadas, el rendimiento cayó y el método más resistente cambió según el ataque.

Con una contaminación completa no hubo un ganador universal. Resistir instrucciones maliciosas no significó resistir hechos alterados. STEEL gestionó comparativamente bien Ignore Injection porque su proceso por etapas podía aislar instrucciones y filtrar evidencias inciertas, pero siguió degradándose con FakeGPT, PoisonedRAG y ATA.

ATA fue el ataque más dañino en promedio. Considerando los dos modelos base y todos los métodos, la exactitud media con el 100% de contaminación quedó en el 9,2% bajo ATA, frente al 11,6% con FakeGPT, el 12,2% con PoisonedRAG y el 14,6% con Ignore Injection. Su eficacia procede de un patrón difícil de detectar: cambia el dato decisivo y mantiene un contexto y estilo plausibles.

El benchmark observó además una relación dosis-respuesta. Al sustituir una, dos y después las tres evidencias, la exactitud tendía a caer. Añadir más pasos de razonamiento tampoco solucionó automáticamente el problema: un sistema puede descomponer una afirmación y seguir juzgando cada parte con información contaminada.

La “memoria de la IA” contiene capas diferentes

La palabra memoria resulta útil, pero puede ocultar diferencias técnicas. Una afirmación puede encontrarse en al menos tres lugares:

  1. Contexto temporal: fragmentos recuperados para una respuesta y descartados después.
  2. Infraestructura de recuperación: una caché, índice, base vectorial o repositorio reutilizable.
  3. Parámetros del modelo: patrones aprendidos durante el entrenamiento o la mejora posterior.

GPE evalúa la primera capa: las evidencias suministradas durante la verificación. También aporta un grafo para estudiar dependencia entre fuentes, reutilización y posibles rutas de propagación. No demuestra que una página falsa pase automáticamente al entrenamiento ni que quede codificada en los parámetros.

La contaminación de datos de entrenamiento es otro riesgo del ciclo de vida reconocido por las taxonomías de aprendizaje automático adversarial. Si una información no deseada ha influido en los parámetros, borrar el documento de origen puede no eliminar esa influencia. Corregirla puede exigir filtrado, ajuste, reentrenamiento o técnicas de desaprendizaje. Investigaciones como el benchmark MUSE de Google muestran que el desaprendizaje fiable de modelos de lenguaje sigue siendo difícil: puede deteriorar la utilidad general, filtrar información o fallar con peticiones repetidas y eliminaciones a gran escala.

GEO defensivo: vigilar evidencias, no solo posiciones

Muchas estrategias GEO se centran en conseguir que una marca aparezca en ChatGPT, Gemini, Claude o Perplexity. GPE demuestra por qué hace falta una dimensión defensiva. Una empresa no debe medir únicamente si aparece, sino si la descripción que construye el sistema sigue siendo correcta.

Un flujo de defensa práctico incluye:

  1. Definir hechos críticos. Mantener un registro fechado de precios, productos, cargos, ubicaciones, políticas y afirmaciones de seguridad.
  2. Repetir los prompts. Probar las mismas preguntas materiales en varios motores y fechas; una respuesta es solo una muestra.
  3. Guardar las fuentes citadas. Registrar URLs y dominios detrás de cada afirmación, no solo la redacción final.
  4. Comprobar independencia. Buscar sindicación, textos copiados, propiedad común y páginas que procedan de un único origen.
  5. Comparar datos decisivos. Extraer cantidades, nombres, fechas, dosis y causalidad en lugar de confiar únicamente en la similitud general.
  6. Escalar errores persistentes. Si continúan tras corregir la fuente, investigar copias indexadas, almacenadas y publicadas por terceros.

Este control complementa las métricas de visibilidad en buscadores de IA. Las menciones y la cuota de voz miden exposición; la exactitud, procedencia y tasa de contradicción miden la integridad de la información.

Qué no demuestra el estudio

GPE es un benchmark, no una medición de la frecuencia con la que marcas reales sufren ataques en la web. Sus porcentajes controlan un conjunto de tres documentos: una condición del 100% significa que los tres fueron sustituidos en el experimento, no que toda la web esté contaminada.

El trabajo es además un preprint de arXiv y su implementación todavía no se había publicado en la versión 1. Los modelos, prompts, selección de evidencias y métodos evaluados delimitan el resultado. Otros sistemas pueden comportarse de otra forma.

Sobre todo, el paper estudia evidencias durante la recuperación, no el entrenamiento a largo plazo. Afirmar que un error ha entrado en los parámetros exige telemetría y experimentos diferentes. Mantener este límite evita convertir un hallazgo real de seguridad en una conclusión más amplia que sus datos no respaldan.

Una nueva capa de reputación digital

Durante años, las empresas han vigilado Google, reseñas y redes sociales. Ahora también deben observar la versión de su marca que construyen los sistemas de IA: qué hechos aparecen, qué fuentes los sostienen y si varias páginas aparentemente independientes repiten la misma narrativa.

Una afirmación falsa puede ser breve, convincente y estar acompañada de citas. Esa presentación no convierte las evidencias en independientes ni verdaderas. El GEO defensivo consiste en proteger el entorno informativo de una empresa frente a datos falsos, contenidos manipulados y repetición coordinada, y comprobar después si las correcciones llegan realmente a la respuesta.

Fuentes

Preguntas frecuentes

¿Qué es la contaminación GEO?

Es la publicación o inyección deliberada de evidencias engañosas, optimizadas para buscadores y modelos, con el objetivo de que un sistema de IA las recupere y llegue a una conclusión incorrecta.

¿Una información repetida se convierte automáticamente en verdadera para una IA?

No. La repetición no es una prueba y un sistema robusto debe evaluar procedencia, independencia, actualidad y consistencia semántica. GPE demuestra, sin embargo, que los verificadores actuales pueden degradarse con rapidez al sustituir evidencias limpias por evidencias contaminadas.

¿GPE demuestra que una página falsa entra en el entrenamiento del modelo?

No. GPE evalúa evidencias contaminadas durante la recuperación y la verificación. La contaminación de datos de entrenamiento y la información codificada en los parámetros son riesgos distintos que exigen otras pruebas y medidas correctivas.

Monitoriza qué dice la IA y en qué fuentes se apoya

Bee LLM sigue menciones, competidores y fuentes citadas en buscadores de IA. Empieza con el plan Free sin tarjeta.

Empezar gratis

Sigue leyendo: ¿respetan robots.txt los asistentes de IA? · qué hacer cuando la IA inventa datos sobre tu marca.