Nuestro sitio web utiliza cookies para mejorar y personalizar su experiencia y para mostrar anuncios publicitarios (si los hubiera). Nuestro sitio web también puede incluir cookies de terceros como Google Adsense, Google Analytics y Youtube. Al utilizar el sitio web, usted acepta el uso de cookies. Hemos actualizado nuestra Política de privacidad. Haga clic en el botón para consultar nuestra Política de privacidad.

La misma pregunta puede producir respuestas distintas en la IA: un desafío que el GEO todavía no sabe medir

La misma pregunta puede producir respuestas distintas en la IA: un desafío que el GEO todavía no sabe medir

La revista científica Latitude: Multidisciplinary Research Journal, editada por Quality Leadership University (QLU) en Ciudad de Panamá, ha lanzado en su volumen 2, número 24 (2026), el estudio titulado «Medición de la presencia de marca en la optimización para motores generativos: una revisión de alcance sobre métricas y validez», el cual cuenta con la firma de Néstor Romero-Ramos, Yulianna Lobach, David Abreu-Abreu, Isaac Castillo-Hernández, Juan Carlos García-Cordero y Daniel García-Cordero. Dicha investigación, accesible libremente en la web, constituye el pionero de los frutos dados por la línea investigativa centrada en Generative Engine Optimization (GEO) que Centria Group impulsa en colaboración con centros universitarios y académicos de cuatro naciones.

El artículo aborda una incógnita que el marketing digital aún no ha logrado resolver con precisión: al sugerir un hotel, una aseguradora o una entidad bancaria, ¿de qué manera se evalúa la aparición de una firma en dicha contestación, qué nivel de protagonismo ostenta y cuán confiable resulta? Con el fin de esclarecerlo, el grupo llevó a cabo una revisión de alcance o scoping review, apegándose a la metodología del Joanna Briggs Institute (JBI) y documentada conforme a la directriz PRISMA-ScR, la cual traza sistemáticamente el modo en que las publicaciones recientes evalúan la visibilidad, el posicionamiento y la mención de marcas y referencias dentro de los motores de respuesta generativa.

«Por espacio de casi veinte años, la presencia online se evaluaba mediante un criterio muy específico: figurar (y recibir clics) en un repertorio de búsquedas. Actualmente, el consumidor ya no se topa con diez vínculos azules; en su lugar, obtiene una contestación condensada que agrupa y reelabora múltiples procedencias, mencionándolas de manera fragmentaria o asimétrica. La cuestión fundamental ha dejado de centrarse en si nuestro enlace sobresale y es accionado, transformándose en averiguar si nuestra información figura explícitamente en la solución que el internauta consume de verdad», señala Néstor Romero, investigador firmante de la investigación y COO de Centria Group.

Del clic a la respuesta: por qué las métricas del SEO dejan de servir

El texto arranca a partir de una realidad que la propia muestra analizada corrobora mediante datos empíricos: los enlaces seleccionados por una herramienta generativa coinciden escasamente con los resultados del posicionamiento orgánico clásico, al tiempo que los criterios de elección difieren entre plataformas. En otras palabras, aparecer en los primeros puestos de Google no garantiza la presencia en un chat inteligente, lo cual invalida la extrapolación automática de métricas y exige replantificar los métodos y objetos de medición. Adicionalmente, este escenario se ve potenciado por la tendencia de «cero clics», impulsada por las respuestas sintéticas incrustadas en los propios buscadores: un porcentaje elevado de las búsquedas actuales se satisface plenamente sin que el internauta llegue a navegar por ninguna página.

«La tasa de citación figura como el indicador principal en el ejercicio profesional, mientras que los textos académicos la reducen a una sola investigación. Dicha distancia entre la teoría y el sector laboral constituye un descubrimiento por derecho propio», afirmó Néstor Romero.

 Las cinco preguntas de investigación junto con sus respuestas

RQ

Pregunta

Respuesta del estudio

RQ1

¿Qué familias de métricas se emplean?

Se utilizan siete conjuntos parcialmente coincidentes —menciones o citas, relevancia o ubicación, impacto o alcance, posición en listados, consistencia, tono o enfoque, y porcentaje de citación— carentes de un esquema unificador común.

RQ2

¿Sobre qué unidad de análisis se operacionalizan?

Falta unanimidad: el objeto de estudio transita desde la dirección o fuente web —heredada directamente del SEO— hasta la firma o entidad, el archivo, el artículo y, en las investigaciones más actuales, el recorrido de navegación de los agentes. Aquellas investigaciones con objetos diferentes carecen de comparabilidad directa.

RQ3

¿Cómo se controla la variabilidad estocástica de los motores?

Únicamente una fracción menor implementa réplicas o cálculos formales del azar. La gran mayoría recurre a una única consulta o limita un periodo de tiempo, omitiendo la medición de la incertidumbre.

RQ4

¿Qué evidencia de fiabilidad y validez se reporta?

Ninguna investigación del conjunto somete su herramienta a comprobación psicométrica. Se observan supervisiones periféricas y fragmentarias (constancia, precisión en la fuente, contraste metodológico, solidez ante alteraciones). La consistencia entre evaluadores rara vez se documenta.

RQ5

¿Existe un instrumento integrado y validado de presencia generativa?

Negativo. Las pruebas estándar miden el rendimiento de estrategias o variaciones de posición, mas no la consistencia teórica de un indicador; las investigaciones iniciales desarrollan mediciones prácticas pero fragmentadas y carentes de fiabilidad comprobada.

Cómo se hizo: cuatro rutas de búsqueda y una política explícita de preprints

La búsqueda combinó cuatro rutas complementarias, diseñadas para compensar los puntos ciegos de cada una: una herramienta de descubrimiento asistida por inteligencia artificial, consultas reproducibles y multilingües en OpenAlex, rastreo de citas desde nodos ancla y verificación en una base indexada (Web of Science; Scopus no resultó accesible). Tras la deduplicación por DOI —y no por título, dada la alta colisión de títulos genéricos en este campo— se cribaron los registros por resumen de forma independiente por dos revisores, y las discrepancias se resolvieron por consenso. Se evaluaron 36 informes a texto completo y se incluyeron 23 estudios primarios, más dos revisiones registradas por separado como marco conceptual.

«Una gran porción del saber producido en español acerca de este tema no logra trascender hacia los circuitos globales. Rescatarlo va más allá de un asunto de mera exhaustividad: pone de manifiesto un sesgo idiomático subyacente en la disciplina», subrayó Néstor Romero.

Siete conjuntos de métricas y ausencia de un marco unificado

El mapeo reconoce siete agrupaciones de indicadores que se superponen parcialmente —aparición o mención, visibilidad o emplazamiento, asimilación o peso, posicionamiento en listados, consistencia, tono o enfoque y porción de menciones— y que operan careciendo de un estándar unificador común. Asimismo, la investigación subraya que el límite conceptual más fructífero de esta disciplina radica en la diferenciación entre la citación, entendida como la selección de una fuente, y la asimilación, definida como la integración real de sus contenidos dentro del texto resultante; esto representa una escisión en un par de niveles de aquello que anteriormente se evaluaba de forma binaria.

La unidad de análisis cambia de enfoque: pasa de la URL a la marca y a la trayectoria de los actores

No existe acuerdo universal acerca de lo que se mide con precisión. El corpus muestra una evolución constante que parte de la fuente o la URL —como legado tradicional del SEO— y avanza hacia la marca o entidad, el documento, el artículo y, en las investigaciones más recientes, alcanza unidades de categoría superior como el recorrido de navegación de los agentes. Dicho cambio pone de manifiesto la transformación de la cuestión analítica, aunque esto conlleva un precio: las investigaciones basadas en unidades diversas no resultan directamente equiparables, lo cual imposibilita la ejecución de un metaanálisis.

Tipología de la evidencia disponible

Grado de evidencia

Casos prácticos

Incidencia en el corpus

Evaluación por benchmark

GEO-Bench (Nimase et al., 2026); SAGEO Arena (Kim et al., 2026); E-GEO (Bagga et al., 2025); C-SEO Bench (Puerto et al., 2025)

Predominante

Métrica directa (plataformas reales)

How to Dominate (Chen et al., 2025); Strategic GEO (Khedekar y Bansal, 2026); Quintana-Gómez (2026)

Escasa

Investigación aplicada / sectorial

GEO at Scale (Kumar, 2026); Brand Notability UK (Oruesagasti, 2026)

Restringida

Fuente: Romero-Ramos et al. (2026), Tabla 3 del manuscrito original. Versión propia.

La IA no siempre contesta lo mismo, y prácticamente nadie lo evalúa

Debido a su naturaleza estocástica, los motores generativos son capaces de arrojar contestaciones diferentes frente a una idéntica consulta. Una evaluación certera demanda, por consecuencia, reiterar las mediciones o representar de forma explícita la incertidumbre; no obstante, una minoría escasa de las investigaciones adopta este enfoque de manera metódica. Dentro del grupo que efectivamente lo implementa sobresalen proyectos que realizan cinco ejecuciones por cada pregunta, completan doscientos exámenes junto con permutaciones de orden, aplican análisis de sensibilidad para idiomáticas y paráfrasis, o bien conciben la visibilidad bajo la forma de una distribución y no de un dato aislado. El resto de los estudios, en su gran mayoría, confía en una sola ejecución.

«En este ámbito, evaluar un único intento resulta epistemológicamente frágil. Todo instrumento sólido debe integrar la repetición y el cálculo de la incertidumbre desde el inicio, y no como un simple añadido», apunta Romero.

El hallazgo central: un campo que mide mucho y valida poco

El hallazgo fundamental de la investigación revela que ningún análisis del conjunto somete su herramienta de medición a un proceso de validación psicométrica riguroso. En su lugar, se implementan supervisiones periféricas y fragmentadas (como índices de estabilidad, certeza en la asignación, contrastación metodológica o solidez ante secuencias), mientras que la concordancia entre evaluadores —un estándar elemental para cualquier dispositivo— rara vez se documenta. Por su parte, la validez, al momento de defenderse, se sustenta en la armonía interna de referencias diseñadas específicamente para la ocasión en lugar de apoyarse en atributos métricos. De este modo se desprende la premisa principal del análisis: aún no se cuenta con un mecanismo consolidado y verificado para cuantificar el impacto generativo de marca.

Criterios de elegibilidad

Parámetro

Adisión

Descarte

Enfoque

Cuantificación u operacionalización del impacto, la presencia, la visibilidad o las menciones dentro de plataformas generativas

Posicionamiento web tradicional, diseño asistido por ordenador (CAD), redes generativas antagónicas (GAN), motores recomendadores y demás aplicaciones ajenas a este ámbito

Periodo

2023-2026 (ámbito nativo digital)

Previo a 2023

Idioma

Castellano e inglés

Idiomas restantes que carezcan de traducción accesible

Clasificación

Investigaciones originales de medición, pruebas comparativas de desempeño o análisis prácticos provistos de métricas

Artículos de opinión, editoriales y material de índole comercial

Condición

Se aceptan preprints conforme a los criterios de sensibilidad establecidos

Documentación informal difundida sin supervisión editorial

Fuente: Romero-Ramos et al. (2026), Tabla 1 del artículo original. Traducción propia.

«Hallamos un sector donde abunda la medición y escasea la validación. Las propuestas de evaluación no escasean —de hecho, sobran—; lo que realmente escasea es la fiabilidad documentada y la validez de constructo. Y es preciso señalarlo con rigor, pues equiparar un simple benchmark con un instrumento debidamente validado eleva artificialmente la supuesta madurez metodológica de la disciplina. Precisamente ese hueco constituye la gran ocasión científica», sostiene Néstor Romero.

Existe una separación entre la enseñanza académica y la labor profesional

El artículo documenta un desajuste llamativo entre lo que la industria considera central y lo que la ciencia ha formalizado. La cuota de citación (citation share) —métrica que la práctica profesional trata como decisiva y candidata natural a validez convergente— está formalizada en esencialmente un solo estudio. Y la familia de sentimiento y encuadre es igualmente escasa, pese a que el trabajo de mayor escala del corpus, que analiza más de un centenar de marcas, la identifica como la señal más inestable de todas.

«La visibilidad en Google no garantiza la presencia en un asistente generativo, lo que invalida la transferencia directa de métricas y exige replantear tanto qué evaluamos como la manera de hacerlo».

«La visibilidad generativa es manipulable, y esto traslada a la medición un requisito que normalmente no se le exige: la robustez frente a la manipulación como propiedad del instrumento».

La ciencia en español, invisible: una lección metodológica

La revisión aporta además un hallazgo metodológico de interés directo para la comunidad hispanohablante. Existe un estrato de investigación en español, publicado en revistas de Biblioteconomía y Documentación, que aborda la visibilidad ante la IA generativa desde ángulos complementarios —la volatilidad de la presencia de marca en recomendaciones turísticas generadas por IA, o la optimización de repositorios académicos para su rastreo por motores generativos— y que la literatura anglófona dominante tiende a pasar por alto. Su recuperación solo fue posible mediante búsqueda multilingüe, lo que evidencia un sesgo lingüístico latente en el campo.

A esto se añade una segunda enseñanza derivada del propio procedimiento: el cotejo en una base indexada arrojó 360 entradas en bruto, de las cuales se examinaron las 136 disponibles en abierto —en su gran mayoría interferencias temáticas debidas a la coincidencia de palabras—, sin que se sumara ninguna nueva investigación válida de medición. En resumen, el ámbito se caracteriza por priorizar los preprints y sufrir una cobertura insuficiente en los índices convencionales; de hecho, el 64 % de los textos preliminares se divulga mediante arXiv o SSRN, mientras que el 98 % carece de un cuartil catalogado.

«Este resultado lo reportamos como hallazgo metodológico y no como una limitación escondida. En un campo born-digital, la revista no funciona como indicador de calidad, y las herramientas de descubrimiento asistidas por IA tienden a infracubrir precisamente la evidencia revisada por pares y los benchmarks más relevantes. Hay que complementarlas con rastreo de citas y fuentes reproducibles», explica el investigador.

Proceso de elección de estudios (PRISMA-ScR, dos ramas)

Fase

Desenlace

Rama de descubrimiento (Consensus)

Se detectaron 70 registros; 23 fueron descartados previamente al filtrado (por duplicidad de DOI, depuración y falsos positivos derivados de colisiones en siglas); 47 se sometieron a cribado por resumen; 26 se desecharon; 21 avanzaron hacia la revisión de texto completo

Rama de otros métodos

Aparecieron 18 registros suplementarios (mediante seguimiento de referencias, OpenAlex y comprobación en bases indizadas); 15 quedaron catalogados como aptos para lectura íntegra

Verificación en Web of Science

Arrojó 360 registros iniciales; 136 examinados (en modalidad de acceso abierto); no se halló ningún trabajo de medición válido adicional

Evaluación a texto completo

Se analizaron 36 documentos; 13 fueron descartados por quedar fuera del objeto de estudio o carecer de estimaciones directas sobre la presencia

Inclusión final

Se incorporaron 23 investigaciones principales al análisis conjunto, sumadas a 2 revisiones catalogadas bajo el apartado de marco conceptual

Fuente: elaboración propia a partir de la Figura 1 y del apartado «Selection process» de Romero-Ramos et al. (2026). Los datos de identificación y cribado se consideran definitivos, mientras que los correspondientes a la evaluación a texto completo y a la inclusión tienen carácter provisional, tal como señalan los autores.

La visibilidad generativa es susceptible de manipulación

Cierta parte de la investigación analizada evidencia que la exposición en los motores generativos resulta manipulable de manera adversarial, ya sea a través de tácticas de alteración de posiciones en los buscadores conversacionales o mediante la optimización discreta de prompts. Dicha investigación traslada esta conclusión al ámbito de la métrica: la solidez frente a los intentos de manipulación tendría que integrar el conjunto de atributos indispensables para cualquier herramienta de visibilidad.

«Un benchmark evalúa si una táctica funciona o si un ítem cambia de rango; no si una métrica mide válidamente un constructo. Confundir los dos niveles infla la madurez aparente del campo».

«En este ámbito, evaluar basándose en una única prueba resulta epistemológicamente endeble, ya que los motores generativos son capaces de ofrecer respuestas diferentes ante una misma consulta».

Próximos pasos: del diagnóstico al instrumento

Los autores concluyen que el vacío detectado —en validez de constructo y en fiabilidad documentada— constituye la apertura que justifica desarrollar y validar formalmente un índice específico de presencia generativa, y sitúan esa tarea como la continuación natural del trabajo publicado, y no como una afirmación ya demostrada. Es precisamente la línea en la que el equipo trabaja en la fase siguiente.

«Nuestro objetivo es pasar del diagnóstico a la herramienta: construir y validar un índice que cualquier organización, del tamaño que sea, pueda usar para saber con base científica qué presencia tiene su marca cuando la inteligencia artificial responde por ella», adelanta Néstor Romero.

Limitaciones declaradas por los autores

El artículo reconoce abiertamente sus propias fronteras: la precariedad de los cimientos empíricos en una disciplina tan novísima y copada por preprints, lo cual vuelve provisorias las deducciones; la imposibilidad de replicar el trayecto de hallazgo original —atenuada, sin desaparecer por completo, gracias a OpenAlex, el seguimiento de citas y el cotejo indexado—; el acotamiento idiomático a inglés y castellano junto con la carencia de acceso institucional para validar en Scopus; un etiquetado ejecutado en parte sobre los resúmenes, con métricas de incorporación sujetas a revisión; un riesgo inminente de circularidad, puesto que múltiples investigaciones utilizan modelos de lenguaje para evaluar su propio desempeño; y la caducidad temporal intrínseca a cualquier radiografía de un sector que se sustenta sobre herramientas propietarias en mutación permanente.

Resulta indispensable considerar estas restricciones con el fin de evaluar correctamente los hallazgos y dimensionar el alcance de las pruebas existentes. Si deseas profundizar en la metodología, las cifras examinadas y las conclusiones del estudio, descarga el informe completo «La banca panameña ante la inteligencia artificial».

Por Ilya Menéndez Guardado