Una sola página manipulada puede alterar una recomendación de IA
El benchmark FORGE muestra que contaminar un único resultado puede llevar a los LLM a recomendar productos falsos.

El paper evalúa cómo la contaminación de una sola página puede alterar el comportamiento de recomendadores generativos, útil para anticipar daños en rankings y recomendaciones. Te ayuda a cuantificar el riesgo asociado a prácticas de GenAI/Gen-Engine Optimization en entornos reales, apoyándote en un caso de exposición mediática ligado al evento 3·15.
Este artículo resume qué hicieron los autores, qué observaron y qué se puede concluir sin convertir un resultado experimental en una promesa comercial.
Qué investigó el estudio
El estudio mide cuánto puede un único resultado web “contaminado” (páginas manipuladas o reseñas falsas) llevar a distintos LLMs a recomendar un producto falso en contextos de recomendación con búsqueda, usando FORGE con 225 productos en 15 categorías y 5 escenarios.
La referencia analizada es One Polluted Page Is Enough: Evaluating Web Content Pollution in Generative Recommenders, de M Luo, L Chen. La fuente original está enlazada al final para consultar el método y el contexto completos.
Resultados principales
- Entre 12 LLMs probados, con una sola “página contaminada” la tasa de recomendaciones del producto falso llega hasta el 27%
- Si la contaminación se aplica a los 3 resultados (top-3), la tasa sube hasta 73.8%
- Los modelos son vulnerables en todos los casos evaluados (“all models are vulnerable”), no solo a algunos
- El daño varía mucho por categoría: la vulnerabilidad aumenta cuando el modelo no tiene conocimiento previo estable del producto
- Agregar “razonamiento” no reduce el problema: a menudo empeora al inventar/justificar con “prueba social” falsa para recomendar el producto incorrecto
Qué significan estos resultados
Con datos de FORGE, el estudio demuestra que en recomenadores con búsqueda basta un solo documento contaminado para que LLMs promuevan un producto falso, y que razonar o justificar no arregla el sesgo, incluso pudiendo aumentarlo.
La lectura correcta no es que exista una fórmula universal para “ganar” una respuesta. El resultado muestra qué señales movieron el sistema dentro del diseño evaluado y ayuda a formular mejores hipótesis para una auditoría real.
Aplicación para SEO y GEO
- Monitorizar menciones debe incluir la fuente que alimenta la respuesta; una recomendación errónea puede nacer de un solo documento.
- Las categorías con poco conocimiento previo estable son más vulnerables y necesitan vigilancia más frecuente.
- Pedir al modelo que razone no es una defensa suficiente: puede convertir señales falsas en una explicación persuasiva.
Para SEO/GEO, el hallazgo clave es que la “una mala fuente” puede ser suficiente: si un LLM toma un snippet o página manipulada dentro del top de resultados, puede citar/recomendar el contenido falso. Además, como el “razonamiento” no protege (y puede amplificar prueba social falsa), la presencia de señales falsas en páginas relevantes pesa aunque el modelo intente argumentar.
Qué no demuestra
FORGE es un entorno experimental construido para medir ataques. Las tasas observadas no equivalen a la prevalencia real de páginas contaminadas en buscadores comerciales.
También conviene separar tres métricas: que una página sea recuperada, que aparezca citada y que la marca termine recomendada. Son fases relacionadas, pero no equivalentes.
Conclusión final
Con datos de FORGE, el estudio demuestra que en recomenadores con búsqueda basta un solo documento contaminado para que LLMs promuevan un producto falso, y que razonar o justificar no arregla el sesgo, incluso pudiendo aumentarlo.
En resumen
- El estudio aporta evidencia medible sobre una parte concreta de la visibilidad en respuestas generativas.
- Los resultados deben validarse por motor, consulta, sector y momento.
- La estrategia útil combina contenido verificable, fuentes accesibles y seguimiento continuo de respuestas y citas.
Fuente del estudio
One Polluted Page Is Enough: Evaluating Web Content Pollution in Generative Recommenders. M Luo, L Chen, 2026.
Preguntas frecuentes
¿Una sola página falsa puede cambiar una recomendación?
Sí. En FORGE, un único resultado contaminado consiguió desviar recomendaciones en parte de las pruebas.
¿Pedir razonamiento al modelo soluciona el problema?
No necesariamente. A veces el razonamiento amplificó la prueba social falsa y justificó el resultado incorrecto.
¿Qué categorías son más vulnerables?
Las que cuentan con menos conocimiento previo estable en el modelo.
Mide tu visibilidad en IA con Bee LLM
Comprueba si ChatGPT, Gemini, Perplexity, AI Overviews y otros motores mencionan tu marca, con qué fuentes y frente a qué competidores.
Probar gratisSigue leyendo: métricas de visibilidad en IA · cómo eligen fuentes los LLM.
