La publicación científica Latitude: Multidisciplinary Research Journal, dirigida por Quality Leadership University (QLU) en Ciudad de Panamá, dio a conocer dentro de su volumen 2, número 24 (2026), el estudio titulado «Medición de la presencia de marca en la optimización para motores generativos: una revisión de alcance sobre métricas y validez», el cual fue elaborado por Néstor Romero-Ramos, Yulianna Lobach, David Abreu-Abreu, Isaac Castillo-Hernández, Juan Carlos García-Cordero y Daniel García-Cordero. Dicha investigación, accesible libremente en la web, constituye el producto inicial de la línea de estudio centrada en Generative Engine Optimization (GEO) que impulsa Centria Group en colaboración con diversas entidades académicas y universitarias de cuatro naciones.
Este texto aborda una cuestión que el marketing digital actual aún no logra resolver con precisión científica: al sugerir un hotel, una póliza de seguros o una entidad financiera un asistente de inteligencia artificial, ¿de qué manera se evalúa la aparición de una firma en dicha contestación, qué nivel de protagonismo ostenta y cuán fiable resulta? Con el fin de despejar esta incógnita, los investigadores llevaron a cabo una revisión exhaustiva basada en la metodología del Joanna Briggs Institute (JBI), ajustándose además a la directriz PRISMA-ScR; de este modo, se traza un mapa sistemático sobre la forma en que los estudios recientes cuantifican la visibilidad, las menciones y el posicionamiento de marcas y fuentes dentro de los sistemas conversacionales.
«Casi veinte años atrás, la presencia en el entorno digital dependía de una destreza muy específica: figurar, y recibir clics, en un índice de resultados. En la actualidad, el internauta ya no se topa con diez vínculos azules, sino que obtiene una contestación elaborada que agrupa y reelabora múltiples procedencias, mencionándolas de manera fragmentaria o desequilibrada. El dilema central ya no radica en si nuestro hipervínculo sale y es accionado, sino en si la información se integra en la contestación que la persona efectivamente visualiza», señala Néstor Romero, investigador firmante del informe y COO de Centria Group.
Del clic a la respuesta: por qué las métricas del SEO dejan de servir
El texto arranca a partir de una realidad que la propia muestra analizada corrobora mediante datos empíricos: los enlaces seleccionados por una herramienta generativa coinciden escasamente con los resultados del posicionamiento orgánico clásico, al tiempo que los criterios de elección difieren entre plataformas. En otras palabras, aparecer en los primeros puestos de Google no garantiza la presencia en un chat inteligente, lo cual invalida la extrapolación automática de métricas y exige replantificar los métodos y objetos de medición. Adicionalmente, este escenario se ve potenciado por la tendencia de «cero clics», impulsada por las respuestas sintéticas incrustadas en los propios buscadores: un porcentaje elevado de las búsquedas actuales se satisface plenamente sin que el internauta llegue a navegar por ninguna página.
«La cuota de citación es la métrica que la práctica profesional trata como central, y en la literatura académica está formalizada en un único estudio. Esa brecha entre industria y academia es en sí misma un hallazgo», dijo Néstor Romero.
Las cinco preguntas de investigación y sus respuestas
| RQ | Pregunta | Respuesta del estudio |
| RQ1 | ¿Qué familias de métricas se emplean? | Existen siete conjuntos de indicadores parcialmente coincidentes —frecuencia de citación, relevancia posicional, impacto de absorción, clasificación en listados, consistencia, polarización temática y proporción de referencias—, carentes de un enfoque metodológico unificador. |
| RQ2 | ¿Sobre qué unidad de análisis se operacionalizan? | Falta un acuerdo generalizado: el objeto de estudio se desplaza desde el dominio o URL —herencia clásica del posicionamiento web— hacia la entidad corporativa, el informe, el artículo y, en las investigaciones más recientes, los recorridos automatizados de los agentes. Aquellos trabajos con objetos diferentes carecen de comparabilidad directa. |
| RQ3 | ¿Cómo se controla la variabilidad estocástica de los motores? | Tan solo una pequeña parte de los autores implementa réplicas o cálculos formales para gestionar la aleatoriedad. La mayor parte de la literatura recurre a una única consulta o limita el análisis a un periodo específico, obviando la medición del error. |
| RQ4 | ¿Qué evidencia de fiabilidad y validez se reporta? | Ninguna investigación analizada somete sus herramientas a pruebas de validación psicométrica. Tan solo se aprecian supervisiones puntuales y complementarias (consistencia temporal, precisión en las fuentes, validación cruzada y resistencia al sesgo secuencial). La concordancia entre evaluadores apenas se documenta. |
| RQ5 | ¿Existe un instrumento integrado y validado de presencia generativa? | En absoluto. Las pruebas estandarizadas miden el rendimiento de tácticas o variaciones de posición, mas no la validez conceptual de los indicadores; asimismo, las investigaciones principales utilizan parámetros prácticos pero incompletos y carentes de fiabilidad probada. |
Cómo se hizo: cuatro rutas de búsqueda y una política explícita de preprints
La búsqueda combinó cuatro rutas complementarias, diseñadas para compensar los puntos ciegos de cada una: una herramienta de descubrimiento asistida por inteligencia artificial, consultas reproducibles y multilingües en OpenAlex, rastreo de citas desde nodos ancla y verificación en una base indexada (Web of Science; Scopus no resultó accesible). Tras la deduplicación por DOI —y no por título, dada la alta colisión de títulos genéricos en este campo— se cribaron los registros por resumen de forma independiente por dos revisores, y las discrepancias se resolvieron por consenso. Se evaluaron 36 informes a texto completo y se incluyeron 23 estudios primarios, más dos revisiones registradas por separado como marco conceptual.
«Una gran porción del saber producido en castellano acerca de este asunto no logra trascender hacia los ámbitos internacionales. Rescatarlo va más allá de un simple afán de completitud: pone al descubierto un prejuicio idiomático latente dentro de la disciplina», puntualizó Néstor Romero.
Siete grupos de indicadores y ningún modelo que los unifique
El mapeo identifica siete familias de métricas parcialmente solapadas —aparición/citación, prominencia/posición, absorción/influencia, ranking en listas, estabilidad, sentimiento/encuadre y cuota de citación— que conviven sin un marco integrador compartido. El estudio destaca además que la frontera conceptual más fértil del campo es la distinción entre citación (que una fuente sea seleccionada) y absorción (que su contenido se incorpore efectivamente al texto de la respuesta), un desdoblamiento en dos capas de lo que antes se medía como un binario.
La unidad de análisis se mueve: de la URL a la marca y a la trayectoria de los agentes
No existe consenso sobre qué se mide exactamente. El corpus revela un desplazamiento progresivo desde la fuente o la URL (herencia directa del SEO) hacia la marca o entidad, el documento, el producto y, en los trabajos más recientes, hacia unidades de orden superior como la trayectoria de navegación de los agentes. Ese desplazamiento refleja la migración de la pregunta del campo, pero tiene un coste: los estudios con unidades distintas no son directamente comparables, lo que refuerza la imposibilidad de realizar un metaanálisis.
Tipología de la evidencia disponible
|
Grado de evidencia |
Casos de estudio |
Relevancia en el corpus |
|
Benchmark de evaluación |
GEO-Bench (Nimase et al., 2026); SAGEO Arena (Kim et al., 2026); E-GEO (Bagga et al., 2025); C-SEO Bench (Puerto et al., 2025) |
Predominante |
|
Medición primaria (motores reales) |
How to Dominate (Chen et al., 2025); Strategic GEO (Khedekar y Bansal, 2026); Quintana-Gómez (2026) |
Escasa |
|
Estudio aplicado / comercial |
GEO at Scale (Kumar, 2026); Brand Notability UK (Oruesagasti, 2026) |
Reducida |
Fuente: Romero-Ramos et al. (2026), Tabla 3 del manuscrito original. Versión propia.
La inteligencia artificial no siempre contesta igual, y prácticamente nadie lo evalúa
Los motores generativos poseen un carácter estocástico, lo que significa que arrojan resultados diferentes frente a una misma consulta. Por consiguiente, una evaluación fidedigna requiere replicar las pruebas o representar formalmente la incertidumbre; no obstante, una escasa proporción de las investigaciones adopta este enfoque de manera metódica. Entre los pocos casos que lo implementan sobresalen iniciativas que realizan cinco corridas por pregunta, 200 valoraciones acompañadas de permutaciones secuenciales, pruebas de sensibilidad lingüística y de reformulación, o bien enfoques donde la visibilidad se concibe como un espectro probabilístico en vez de una cifra aislada. En contraste, el grueso de los análisis restantes se conforma con una sola ejecución.
«Una medición de una sola ejecución es, en este dominio, epistemológicamente frágil. Cualquier instrumento robusto tiene que incorporar la repetición y la modelización de la incertidumbre como requisito, no como un refinamiento opcional», señala Romero.
El descubrimiento principal: un campo que abarca demasiado pero certifica muy poco
El hallazgo definitivo del análisis indica que ningún artículo del corpus somete su herramienta de medición a un proceso de validación psicométrica rigurosa. En su lugar, se implementan revisiones accesorias y fragmentadas (como índices de estabilidad, certeza en la atribución, contraste metodológico por diseño o solidez frente al orden), mientras que la concordancia entre evaluadores, que constituye una condición elemental para cualquier instrumento, rara vez se documenta. Por otra parte, la validez, cuando se defiende, se apoya en la consistencia interna de referencias diseñadas específicamente para la ocasión en lugar de apoyarse en atributos de medición propiamente dichos. De este modo, se desprende la premisa fundamental del mapeo: todavía carecemos de un mecanismo unificado y contrastado capaz de cuantificar la huella generativa de marca.
Requisitos de admisión
| Criterio | Inclusión | Exclusión |
| Foco | Medición u operacionalización de presencia, visibilidad, citación o influencia en motores generativos | SEO clásico, diseño generativo (CAD), GAN, sistemas de recomendación u otros usos ajenos al dominio |
| Ventana temporal | 2023-2026 (campo born-digital) | Anterior a 2023 |
| Idioma | Español e inglés | Otros idiomas sin traducción disponible |
| Tipo | Estudio primario de medición, benchmark de evaluación o estudio aplicado con métricas | Editoriales, artículos de opinión, contenido promocional |
| Estatus | Preprints admitidos bajo política de sensibilidad | Literatura gris autopublicada sin control editorial |
Fuente: Romero-Ramos et al. (2026), Tabla 1 del manuscrito original. Versión propia en castellano.
«Hallamos un terreno que cuantifica en exceso pero acredita de manera escasa. No escasean las propuestas de medición —de hecho, sobran—; lo que escasea es la validez de constructo junto a una fiabilidad debidamente acreditada. Cabe precisarlo con rigor, puesto que equiparar un parámetro de referencia con una herramienta contrastada eleva artificialmente la supuesta madurez metodológica de la disciplina. Precisamente ese hueco constituye la gran ocasión científica», sostiene Néstor Romero.
Existe una separación entre la enseñanza académica y la labor profesional
El texto expone una discrepancia notable entre aquello que el sector valora como prioritario y lo que la investigación académica ha consolidado. La participación en citas (citation share) —un indicador al que la actividad laboral otorga un carácter determinante y ve como un candidato ideal para lograr validez convergente— se sustenta fundamentalmente en una única investigación. Del mismo modo, el conjunto vinculado al sentimiento y al encuadre cuenta con un respaldo igual de limitado, a pesar de que la investigación más amplia del conjunto, la cual examina más de un centenar de marcas, la señala como el indicador más volátil de todos.
«a visibilidad en Google no predice la visibilidad en un asistente generativo. Eso invalida la transferencia directa de indicadores y obliga a repensar qué medimos y cómo».
«La visibilidad generativa es manipulable, y esto traslada a la medición un requisito que normalmente no se le exige: la robustez frente a la manipulación como propiedad del instrumento».
La ciencia en español, invisible: una lección metodológica
La revisión aporta además un hallazgo metodológico de interés directo para la comunidad hispanohablante. Existe un estrato de investigación en español, publicado en revistas de Biblioteconomía y Documentación, que aborda la visibilidad ante la IA generativa desde ángulos complementarios —la volatilidad de la presencia de marca en recomendaciones turísticas generadas por IA, o la optimización de repositorios académicos para su rastreo por motores generativos— y que la literatura anglófona dominante tiende a pasar por alto. Su recuperación solo fue posible mediante búsqueda multilingüe, lo que evidencia un sesgo lingüístico latente en el campo.
A ello se suma una segunda lección del propio proceso: la verificación en una base indexada aportó 360 registros brutos, de los que se revisaron los 136 en acceso abierto, en su mayoría ruido temático por colisión de términos, y no incorporó ningún estudio de medición elegible nuevo. El campo es, en definitiva, preprint-first y está infracubierto por la indexación tradicional: el 64 % del corpus candidato se difunde a través de arXiv o SSRN y el 98 % carece de cuartil indexado.
«Este resultado lo reportamos como hallazgo metodológico y no como una limitación escondida. En un campo born-digital, la revista no funciona como indicador de calidad, y las herramientas de descubrimiento asistidas por IA tienden a infracubrir precisamente la evidencia revisada por pares y los benchmarks más relevantes. Hay que complementarlas con rastreo de citas y fuentes reproducibles», explica el investigador.
Proceso para elegir los estudios (PRISMA-ScR, dos ramas)
| Fase | Hallazgo |
| Fase de búsqueda (Consensus) | Se identificaron 70 registros; 23 descartados de forma previa al filtrado (duplicados por DOI, depuración y falsos positivos debidos a colisión de siglas); 47 sometidos a revisión por resumen; 26 descartados; 21 evaluados a texto completo |
| Fase de métodos complementarios | 18 referencias adicionales (búsqueda de citas, OpenAlex y comprobación en bases indexadas); 15 elegibles para texto completo |
| Comprobación en Web of Science | 360 registros iniciales; 136 analizados (de acceso abierto); ningún nuevo trabajo de medición apto |
| Revisión del texto completo | Se examinaron 36 informes; 13 descartados (por no ajustarse al alcance o carecer de medición directa de presencia) |
| Selección definitiva | Se incorporaron 23 investigaciones primarias a la síntesis, además de 2 revisiones documentadas como marco teórico |
Fuente: elaboración propia a partir de la Figura 1 y del apartado «Selection process» de Romero-Ramos et al. (2026). Las cifras de identificación y cribado son firmes; las de evaluación a texto completo e inclusión, provisionales, según declaran los autores.
La visibilidad generativa es susceptible de manipulación
Cierta parte de la investigación analizada evidencia que la exposición en los motores generativos resulta manipulable de manera adversarial, ya sea a través de tácticas de alteración de posiciones en los buscadores conversacionales o mediante la optimización discreta de prompts. Dicha investigación traslada esta conclusión al ámbito de la métrica: la solidez frente a los intentos de manipulación tendría que integrar el conjunto de atributos indispensables para cualquier herramienta de visibilidad.
«Una prueba de rendimiento comprueba si una estrategia resulta eficaz o si un elemento varía de posición, pero no determina si un indicador mide adecuadamente un constructo. Mezclar ambos planos magnifica el grado de desarrollo ficticio de la disciplina».
«En este ámbito, evaluar basándose en una única prueba resulta epistemológicamente endeble, ya que los motores generativos son capaces de ofrecer respuestas diferentes ante una misma consulta».
Próximos pasos: del diagnóstico al instrumento
Los investigadores concluyen que la carencia hallada —en lo referente a la validez de constructo y a la fiabilidad constatada— representa el resquicio que legitima la creación y validación oficial de un índice particular de presencia generativa, planteando dicha labor como la prolongación lógica del estudio difundido, más no como una tesis ya probada. Se trata justamente del camino en el cual el grupo se encuentra laborando en el paso venidero.
«Nuestro objetivo es pasar del diagnóstico a la herramienta: construir y validar un índice que cualquier organización, del tamaño que sea, pueda usar para saber con base científica qué presencia tiene su marca cuando la inteligencia artificial responde por ella», adelanta Néstor Romero.
Limitaciones declaradas por los autores
El texto deja claros sus propios confines: la fragilidad de los datos en una disciplina tan novísima y dominada por preprints, lo cual vuelve provisorias las deducciones; la imposibilidad de replicar el trayecto de hallazgo originario —contrarrestada, si bien no suprimida, mediante OpenAlex, el seguimiento de citas y el cotejo indexado—; el acotado radio idiomático al inglés y al castellano junto con la carencia de validación en Scopus debido a la ausencia de convenios universitarios; un etiquetado efectuado en parte sobre los resúmenes, con métricas de admisión sujetas a revisión; el riesgo de incurrir en circularidad, puesto que múltiples investigaciones utilizan inteligencias artificiales evaluadoras de su propia evaluación; y la caducidad temporal que afecta a cualquier radiografía de un ámbito sustentado en herramientas propietarias en mutación permanente.
Resulta indispensable considerar estas restricciones con el fin de evaluar correctamente los hallazgos y dimensionar el alcance de las pruebas existentes. Si deseas profundizar en la metodología, las cifras examinadas y las conclusiones del estudio, descarga el informe completo «La banca panameña ante la inteligencia artificial».
