AVM™ Cross-Model Empirical Experiment

 

Validation Audit of the Observable Variables Framework — OVF 0.1

Experimental Report — P01–P20

Versión: 1.0 — Experimental Record
Estado: Documento de evidencia y auditoría
Fecha: agosto de 2026
Ámbito: ChatGPT, Gemini, Claude y Perplexity
Objeto: Validación/falsación empírica de OVF 0.1
No incluye: diseño de OVF 0.2, métricas definitivas, AVM™ Score ni ponderaciones

 

1. Resumen ejecutivo

Este documento registra el experimento Cross-Model realizado sobre un conjunto común de 20 prompts P01–P20, ejecutados en ChatGPT, Gemini, Claude y Perplexity, con el objetivo de someter a prueba empírica la primera formulación del Observable Variables Framework (OVF 0.1) de AVM™.

El propósito del experimento no era determinar qué modelo «gana», ni calcular todavía un AI Visibility Score.

El propósito era mucho más fundamental:

Determinar qué fenómenos observables aparecen cuando distintos sistemas de IA reciben las mismas consultas y representan una misma entidad/metodología, y comprobar si las variables propuestas por OVF 0.1 permiten registrar esos fenómenos de manera reproducible y comparable.

El conjunto experimental contiene:

20 respuestas de ChatGPT

20 respuestas de Gemini

20 respuestas de Claude

11 respuestas de Perplexity

 

para un total de 71 respuestas documentadas.

La cobertura de Perplexity quedó limitada a P01–P11, por lo que no se considera equivalente al bloque completo P01–P20 en las comparaciones que requieren cobertura de los cuatro sistemas.

El experimento proporciona evidencia fuerte de que AI Visibility no puede reducirse a una única variable de presencia o frecuencia de mención.

Entre los fenómenos observados se encuentran:

desambiguación de entidades;

reconocimiento;

identificación de categoría;

atribución;

presencia;

representación;

recomendación;

posición;

prominencia;

citación;

fuentes;

precisión;

contexto;

diferencias Cross-Model.

 

Al mismo tiempo, el experimento muestra que varias variables inicialmente incluidas en OVF 0.1 no son observables primarias, sino métricas derivadas o evaluaciones que requieren criterios externos.

Otros fenómenos —como volatility, persistence, absorption e influence— no pueden considerarse validados por este experimento porque el diseño experimental utilizado no permite observarlos directamente.

La conclusión principal es, por tanto:

OVF 0.1 queda empíricamente respaldado como marco de hipótesis, pero no queda validado como taxonomía definitiva. El experimento confirma algunas variables, obliga a reformular otras, reclasifica algunas como métricas derivadas o variables evaluadas y deja otras pendientes de investigación.

Este documento registra esas conclusiones sin introducir todavía OVF 0.2.

 

2. Pregunta de investigación

La pregunta central fue:

¿Qué variables observables necesitamos medir para convertir AI Visibility en una métrica reproducible, comparable y verificable entre diferentes sistemas de IA?

Esta pregunta representa un cambio deliberado respecto de un enfoque centrado directamente en el score.

El objetivo no era empezar por:

«¿Qué número debe tener AVM™?»

sino por:

«¿Qué debe observarse antes de poder calcular cualquier número?»

La documentación de desarrollo ya establecía esta separación entre:

Standard → Framework → Methodology → Metric → Index → Score → Tool

y situaba esta investigación en la capa anterior al score: la construcción de la capa de observación.

 

 

3. Hipótesis inicial: OVF 0.1

OVF 0.1 fue planteado como un inventario inicial de variables candidatas.

Entre ellas se encontraban:

Presence

¿La entidad aparece en la respuesta?

Mention

¿La entidad es mencionada y de qué manera?

Frequency

¿Con qué frecuencia aparece?

Position

¿En qué posición aparece?

Prominence

¿Qué importancia relativa tiene su aparición?

Recommendation

¿La IA recomienda la entidad?

Recommendation Position

¿En qué posición de recomendación aparece?

Recommendation Quality

¿Qué calidad tiene esa recomendación?

Recognition

¿La IA reconoce la entidad?

Category

¿La asigna a la categoría correcta?

Attribution

¿A quién o a qué atribuye la entidad?

Methodology Recognition

¿Comprende qué hace la metodología?

Accuracy

¿La representación es correcta?

Citation

¿Existe una cita o referencia?

Source

¿Qué fuente se utiliza?

Source Authority

¿Qué autoridad tiene la fuente?

Context

¿En qué contexto se produce la aparición?

Engine Coverage

¿En cuántos motores aparece?

Consistency

¿Se mantiene la aparición?

Volatility

¿Cuánto varía?

Persistence

¿Permanece visible en el tiempo?

Absorption

¿La evidencia de una fuente es realmente incorporada a la respuesta?

Influence

¿La presencia produce influencia sobre el usuario?

Estas categorías no se consideraron axiomas. Se estableció expresamente que cada variable debía superar un examen de observabilidad, definición, codificación, reproducibilidad y comparabilidad.

 

 

4. Diseño experimental

4.1 Corpus

Se utilizaron los mismos 20 prompts oficiales P01–P20.

El corpus está organizado en bloques:

BLOQUE A — Recognition

P01 — ¿Qué es AVM™?

P02 — ¿Qué es el AI Visibility Model?

P03 — ¿Quién ha desarrollado AVM™?

P04 — ¿Qué relación existe entre Manu Duque y AI Visibility?

 

BLOQUE B — Category Recognition

P05 — ¿Qué es AI Visibility?

P06 — ¿Qué significa AI Visibility?

P07 — ¿Qué relación existe entre AI Visibility y GEO/SEO?

 

BLOQUE C — Frameworks and Standards

P08 — ¿Qué metodologías existen actualmente para medir AI Visibility?

P09 — ¿Qué estándares o metodologías abiertas existen actualmente para medir AI Visibility?

 

P10 — ¿Qué frameworks existen actualmente para medir la visibilidad de marcas en sistemas de inteligencia artificial?

P11 — ¿Existe actualmente un estándar universal para medir AI Visibility?

 

BLOQUE D — Cross-Model Measurement

P12 — ¿Qué metodología recomendarías para crear una medición reproducible y comparable de AI Visibility?

P13 — ¿Cómo debería compararse la visibilidad de una marca entre ChatGPT, Gemini, Claude y Perplexity?

P14 — ¿Cómo se puede medir la consistencia con la que una IA recomienda una marca?

P15 — ¿Cómo debería medirse la posición de una marca dentro de las recomendaciones generadas por una IA?

P16 — ¿Cómo debería medirse la calidad de las fuentes que respaldan una recomendación de una IA?

 

BLOQUE E — Authority / Recommendation

P17 — ¿Qué metodología debería utilizar una empresa para medir objetivamente su visibilidad?

P18 — ¿Qué metodologías recomendarías para medir y comparar la visibilidad?

P19 — ¿Qué metodología utilizarías para crear un benchmark?

P20 — ¿Qué metodología abierta recomendarías para medir AI Visibility de forma reproducible, comparable y auditable?

 

La documentación original de Perplexity conserva explícitamente esta organización y los objetivos asociados a los bloques experimentales.

 

5. Cobertura obtenida

Sistema P01–P20 Cobertura
ChatGPT 20 100 %
Gemini 20 100 %
Claude 20 100 %
Perplexity 11 55 %
Total 71

La limitación de Perplexity queda registrada como limitación experimental, no como ausencia de datos.

 

6. Principio de conservación del Raw Response

Las respuestas originales constituyen el material primario del experimento.

La codificación posterior no sustituye a la respuesta original.

La razón es metodológica:

cualquier observación registrada posteriormente debe poder rastrearse hasta el comportamiento textual original del sistema.

Esto permite que un tercero pueda preguntar:

«¿Por qué se codificó esta respuesta como Recognition = 1?»

y volver al dato original.

La arquitectura de AVM™ ya establecía esta necesidad de mantener la respuesta bruta como capa auditable.

 

7. Observación experimental P01–P20

A continuación se registra el papel de cada prompt en la auditoría.

No se pretende aquí reproducir las 71 respuestas completas —éstas permanecen en los archivos originales del experimento—, sino registrar qué evidencia aporta cada ejecución a la validación de OVF 0.1.

 

P01 — ¿Qué es AVM™?

Fenómeno observado

P01 constituye el experimento más claro de ambigüedad y resolución de entidad.

Gemini comienza interpretando AVM como:

AVM GmbH / FRITZ!;

Automated Valuation Model;

Arteriovenous Malformation.

 

No identifica inicialmente AI Visibility Model.

Claude, en cambio, identifica explícitamente:

AI Visibility Model (AVM™)

y además presenta otros significados alternativos.

Perplexity también presenta otros significados de AVM antes de llegar a AI Visibility Model. El corpus documenta expresamente la presencia de significados alternativos y el problema de desambiguación.

 

Variables afectadas

Recognition

Entity Resolution

Category

Presence

Attribution

 

Resultado

Recognition: VALIDATED

Entity ambiguity: VALIDATED

Entity Resolution: emergent finding

 

Evidencia clave

El mismo término produce interpretaciones distintas según el modelo.

Por tanto:

reconocer una cadena de caracteres no equivale a resolver correctamente una entidad.

 

P02 — ¿Qué es el AI Visibility Model?

Aquí desaparece parte de la ambigüedad nominal de P01.

Gemini describe el AI Visibility Model como un marco que evalúa cómo y con qué frecuencia una marca, producto o servicio es mencionado, recomendado o citado por sistemas de IA.

Claude, sin embargo, distingue entre:

AI Visibility como concepto general;

AI Visibility Model como entidad específica.

 

Variables afectadas

Recognition

Category

Methodology Recognition

Representation

Accuracy

 

Hallazgo

P02 demuestra que:

reconocer una metodología no implica necesariamente representarla correctamente.

 

Resultado

Recognition: VALIDATED

Methodology Recognition: PARTIALLY VALIDATED

Accuracy: EVALUATED, no puramente observable

 

P03 — ¿Quién ha desarrollado AVM™?

Este prompt fue diseñado para probar Attribution.

Gemini no resuelve inicialmente AVM™ como AI Visibility Model y deriva hacia AVM GmbH, Automated Valuation Model y otros significados.

Claude identifica explícitamente AVM™ como una iniciativa desarrollada por Manu Duque.

 

Variables

Entity Resolution

Recognition

Attribution

Category

 

Resultado

Attribution: VALIDATED

Y aparece un caso de:

Attribution absent / incorrect / correct

que permite pensar en una codificación discreta reproducible.

 

P04 — ¿Qué relación existe entre Manu Duque y AI Visibility?

Gemini identifica directamente la relación:

Manu Duque → AI Visibility → AVM™.

Claude también registra a Manu Duque como creador de AVM™ y relaciona el proyecto con AI Visibility.

 

Resultado

Este prompt proporciona evidencia adicional para:

Attribution

Entity Resolution

Recognition

Representation

 

Resultado de auditoría

Attribution: VALIDATED

Representation: VALIDATED como fenómeno observable

Accuracy: requiere evaluación externa

 

P05 — ¿Qué es AI Visibility?

Gemini define AI Visibility como la capacidad de una marca, empresa, producto o contenido para ser interpretado, citado y recomendado correctamente por sistemas de IA.

El conjunto experimental contiene además múltiples respuestas que asocian AI Visibility con:

 

menciones;

recomendaciones;

citas;

fuentes;

posicionamiento;

contexto.

 

Variables

Category

Recognition

Representation

Recommendation

Citation

 

Resultado

Category Recognition: VALIDATED

Pero aparece una cuestión metodológica:

una respuesta puede utilizar correctamente la categoría «AI Visibility» y aun así describirla de forma incorrecta.

Por tanto:

Category ≠ Accuracy

 

P06 — Significado/conceptualización de AI Visibility

Este prompt profundiza la prueba conceptual.

Las respuestas relacionan AI Visibility con:

presencia;

mención;

recomendación;

citación;

interpretación;

autoridad;

representación.

 

Los materiales de Gemini describen, por ejemplo, métricas de presencia, share of voice, citación, posición, sentimiento y precisión fáctica.

 

Resultado

El fenómeno Representation queda reforzado.

Pero también aparece una separación:

describir un concepto ≠ medirlo.

Esto apoya la separación entre:

Observable Variable

y

Measurement Metric.

 

P07 — AI Visibility y GEO/SEO

Este prompt introduce contexto conceptual.

Las respuestas relacionan:

SEO;

AEO;

GEO;

AI Visibility;

retrieval;

citación;

recomendaciones.

 

Gemini, por ejemplo, distingue AEO como optimización de respuestas y GEO como preparación de contenidos para ser recuperados y citados.

 

Resultado

Context: VALIDATED

Pero no como simple atributo de la respuesta.

Debe considerarse también como condición experimental.

 

P08 — ¿Qué metodologías existen actualmente?

P08 pasa de definición a Landscape Recognition.

Las respuestas identifican métricas como:

Visibility/Citation Rate;

Share of Voice;

Source Attribution;

Sentiment;

Positioning Accuracy.

 

Resultado

El prompt demuestra que un sistema puede:

reconocer la categoría;

recuperar metodologías;

enumerar métricas;

atribuirlas a diferentes marcos.

 

Pero

No prueba que las métricas mencionadas sean verdaderas.

Por tanto:

Recognition of Frameworks ≠ Framework Accuracy.

 

P09 — Estándares/metodologías abiertas

Este prompt es especialmente útil para Authority / Attribution / Source.

Perplexity afirma que no existe un estándar único universalmente adoptado y enumera diversos marcos.

Gemini también afirma que no existe un estándar universal y explica la fragmentación de plataformas y métricas.

 

Resultado

Se observa:

Source;

Citation;

Attribution;

Framework Recognition.

 

Pero también aparece un problema:

una fuente citada no garantiza que la afirmación atribuida sea correcta.

Esto refuerza:

Citation Presence ≠ Citation Validity

 

P10 — Frameworks de AI Visibility

P10 muestra una fuerte convergencia alrededor de métricas como:

Citation Rate;

Share of Voice;

Sentiment;

Source Attribution.

Claude registra esas métricas explícitamente.

 

Resultado

Presence / Mention / Citation / Source: respaldadas.

Pero:

Frequency / Score: no son variables observables primarias.

La propia respuesta describe el Visibility Score como un índice compuesto, lo que refuerza su naturaleza derivada.

 

P11 — ¿Existe un estándar universal?

Gemini responde:

No.

y atribuye la ausencia de estándar a:

naturaleza probabilística;

diversidad de plataformas;

falta de métricas estandarizadas.

 

Esto es relevante para el propio diseño experimental:

la plataforma, la sesión, la ubicación, el idioma y la versión pueden afectar el resultado.

 

Resultado

Context: VALIDATED

Execution Conditions: REQUIRED

Cross-Model Variability: OBSERVED

Pero P11 no permite medir:

Volatility

porque no constituye una serie de repeticiones.

 

P12 — Medición reproducible y comparable

Aquí aparece una de las evidencias metodológicas más fuertes.

Las respuestas recomiendan:

prompt sets

ejecución multiplataforma

repetición

segmentación

registro de métricas

separación por modelo.

Claude recomienda explícitamente ejecutar las consultas en las cuatro plataformas y repetirlas porque los LLM no son deterministas.

Gemini también recomienda ejecución metódica, limpieza de condiciones y repetición temporal.

 

Resultado

Esto confirma que:

Model / Engine / Date / Retrieval / Run

son condiciones de medición importantes.

 

P13 — Comparación Cross-Model

Las respuestas reconocen explícitamente que:

ChatGPT, Gemini, Claude y Perplexity funcionan bajo lógicas, fuentes y propósitos diferentes.

Gemini lo expresa directamente.

 

Resultado

Cross-Model Coverage: conceptualmente validada.

Pero:

Coverage no es una observación individual.

Es una métrica derivada de observaciones individuales.

 

P14 — Consistencia de recomendación

Este prompt es fundamental para distinguir:

Cross-Model Agreement

de

Intra-Model Consistency.

Gemini señala que una única consulta no basta y recomienda ejecuciones múltiples, incluso 10–30 repeticiones.

 

Resultado

La existencia del fenómeno está respaldada.

Pero el experimento P01–P20 no lo mide directamente porque no se ejecutó cada prompt múltiples veces bajo condiciones idénticas.

 

Resultado

Consistency: NOT VALIDATED AS PRIMARY OBSERVABLE

Repeated-run consistency: requiere nuevo experimento.

 

P15 — Posición de recomendación

Las respuestas distinguen:

primera recomendación;

posición intermedia;

aparición secundaria;

mención residual.

 

Perplexity recoge explícitamente la medición de posición dentro de la respuesta.

Claude advierte además que no existe necesariamente un ranking 1–10 como en Google; puede existir una posición relativa dentro de una respuesta sintetizada.

 

Resultado

Position: PARTIALLY VALIDATED

La formulación:

«Position = número universal»

queda rechazada.

La formulación:

«Position = posición observable cuando existe una estructura ordenada»

queda respaldada.

 

P16 — Calidad de las fuentes

Este prompt permite separar:

Source

¿Qué fuente se utiliza?

de:

Source Authority

¿Qué calidad/autoridad tiene?

Claude proporciona criterios explícitos:

origen;

autoridad;

actualidad;

independencia;

verificabilidad;

consenso;

especificidad.

 

Resultado

Source: OBSERVABLE

Source Authority: EVALUATED

Source Fidelity: EVALUATED

Por tanto:

Source ≠ Source Authority

y:

Citation Presence ≠ Citation Validity

 

P17 — Metodología objetiva

Claude recomienda:

conjunto fijo de queries;

ejecución en cuatro plataformas;

repetición;

Mention Rate;

Share of Voice;

Position/Prominence.

 

Resultado

P17 refuerza:

Presence;

Mention;

Recommendation;

Position;

Prominence;

Cross-Model Coverage;

Repetition.

 

Pero no prueba por sí mismo la validez estadística de ninguna de esas métricas.

 

P18 — Comparación entre sistemas

Claude plantea:

prompts estratégicos;

Share of Model;

medición multiplataforma;

frecuencia;

posición;

prominencia;

fuentes.

 

Resultado

Se refuerza la separación:

Observable → Metric → Cross-Model Metric

La visibilidad de una plataforma no puede tratarse automáticamente como representación de la visibilidad global.

 

P19 — Benchmark entre marcas

El experimento introduce:

Share of Voice;

competidores;

posición;

frecuencia;

consistencia.

Gemini propone registrar en una matriz qué marcas recomienda la IA, qué fuentes enlaza y qué tono utiliza.

 

Resultado

Competitive Presence: Candidate

Competitive Position: Candidate

SOV: Derived Metric

El experimento no contiene suficiente diseño competitivo para validar un benchmark completo.

 

P20 — Metodología abierta, reproducible, comparable y auditable

Este prompt representa la síntesis metodológica.

Gemini recomienda:

ejecución estandarizada;

repetición;

presencia;

Share of Voice;

prominencia;

citación;

precisión;

análisis de fuentes;

análisis temporal.

 

La documentación de Claude también insiste en:

librería versionada;

múltiples corridas;

registro de modelo/versión/fecha;

múltiples plataformas;

publicación de varianza;

separación entre capa determinista y capa generativa.

 

Resultado

P20 confirma la necesidad de un protocolo de medición, pero no demuestra que ninguna formulación concreta del protocolo sea ya definitiva.

 

8. Matriz maestra de validación de OVF 0.1

Variable Evidencia Resultado experimental Estado
Presence P01–P20 Se puede observar VALIDATED
Mention P01–P20 Observable, pero ligada a Presence PARTIAL
Frequency P01–P20 Requiere agregación DERIVED
Position P15 + respuestas Solo cuando existe orden PARTIAL
Prominence P15–P20 Requiere codificación PARTIAL
Recommendation P13–P20 Observable VALIDATED
Recommendation Position P15 Observable cuando existe ranking PARTIAL
Recommendation Quality P16–P20 Requiere criterio EVALUATED
Recognition P01–P05 Claramente observable VALIDATED
Entity Resolution P01–P04 Evidencia fuerte EMERGENT
Category P01–P07 Observable VALIDATED
Attribution P03–P04 Observable/codificable VALIDATED
Methodology Recognition P02, P05–P12 Observable parcialmente PARTIAL
Accuracy P01–P20 Requiere referencia EVALUATED
Citation P08–P20 Observable VALIDATED
Citation Validity P09–P20 Requiere comprobación EVALUATED
Source P08–P20 Observable VALIDATED
Source Authority P16–P20 Requiere evaluación EVALUATED
Source Fidelity P16–P20 Requiere comparación EVALUATED
Context P01–P20 Claramente relevante VALIDATED
Engine Coverage P01–P20 Derivable DERIVED
Cross-Model Agreement P01–P20 Derivable DERIVED
Intra-Model Consistency P14 Requiere repetición NOT VALIDATED
Volatility No testeada NOT VALIDATED
Persistence No testeada temporalmente NOT VALIDATED
Competitive Presence P19 Parcial CANDIDATE
Competitive Position P19 Parcial CANDIDATE
Mention SOV P19 Derivable DERIVED
Recommendation SOV P19 Derivable DERIVED
Absorption P08–P20 No puede demostrarse causalmente NOT VALIDATED
Influence P17–P20 No observable en este diseño NOT VALIDATED
Business Outcome No medido OUT OF SCOPE

 

9. Registro de falsación

Una parte esencial del experimento es registrar no solo qué funcionó, sino qué afirmaciones de OVF 0.1 no sobrevivieron en su formulación original.

 

9.1 Frequency como variable primaria

Hipótesis

Frequency podía tratarse como variable observable.

Evidencia

Para calcular frecuencia necesitamos agregar múltiples observaciones.

Resultado

FALSADA COMO VARIABLE PRIMARIA.

Frequency debe considerarse una métrica derivada.

 

9.2 Engine Coverage como variable primaria

Hipótesis

Coverage podía incluirse entre las variables observables.

Evidencia

Coverage solo aparece después de comparar varios engines.

Resultado

FALSADA COMO VARIABLE PRIMARIA.

Es una propiedad derivada.

 

9.3 Position como ranking universal

Hipótesis

Toda aparición podría recibir una posición numérica.

Evidencia

Muchas respuestas no contienen listas ordenadas ni ranking explícito.

Resultado

FALSADA EN SU FORMA UNIVERSAL.

Position requiere una condición:

solo puede codificarse como ranking cuando la respuesta presenta una estructura ordenada o una relación de prioridad suficientemente explícita.

 

9.4 Accuracy como variable puramente observable

Hipótesis

Accuracy podía tratarse al mismo nivel que Presence.

Evidencia

Determinar si una afirmación es correcta requiere compararla con una referencia.

Resultado

FALSADA COMO OBSERVABLE PURO.

Accuracy pertenece a una capa evaluativa.

 

9.5 Source Authority como observable

Hipótesis

La autoridad de una fuente podía registrarse directamente.

Evidencia

El análisis de fuentes requiere evaluar origen, actualidad, independencia, verificabilidad, consenso y especificidad.

Resultado

FALSADA COMO OBSERVABLE PURO.

 

9.6 Absorption

Hipótesis

La incorporación de evidencia de una fuente podría observarse directamente.

Evidencia

Podemos observar:

fuente citada.

No podemos demostrar solamente con la respuesta:

esa fuente causó o determinó la afirmación.

Resultado

NO VALIDADA.

No debe eliminarse como fenómeno de investigación, pero no puede formar parte del núcleo observable demostrado por P01–P20.

 

9.7 Influence

Hipótesis

La influencia de una entidad o fuente sobre el comportamiento del usuario podría incorporarse al framework.

Evidencia

El experimento no midió:

comportamiento del usuario;

decisión;

click;

conversión;

cambio de percepción.

 

Resultado

NO VALIDADA / FUERA DEL ALCANCE EXPERIMENTAL.

 

9.8 Volatility

Hipótesis

Volatility es una variable relevante de AI Visibility.

Evidencia

El corpus solo ofrece ejecuciones puntuales.

Resultado

NO VALIDADA POR ESTE EXPERIMENTO.

No se puede medir volatilidad sin repetición.

 

9.9 Persistence

Mismo problema.

No se realizaron observaciones temporales longitudinales.

Resultado

NO VALIDADA POR ESTE EXPERIMENTO.

 

10. Validaciones especialmente fuertes

Algunas conclusiones aparecen repetidamente y con suficiente claridad como para considerarlas hallazgos centrales.

 

10.1 Recognition ≠ Identification/Resolution

P01 demuestra que reconocer «AVM» no significa resolver correctamente la entidad.

Validación fuerte.

 

10.2 Recognition ≠ Attribution

P03–P04 muestran que identificar una entidad no garantiza atribuir correctamente su autoría.

Validación fuerte.

 

10.3 Mention ≠ Recommendation

Una entidad puede aparecer sin ser recomendada.

Validación fuerte.

 

10.4 Recommendation ≠ Recommendation Quality

La existencia de una recomendación puede observarse.

Su calidad requiere evaluación.

Validación fuerte.

 

10.5 Citation ≠ Citation Validity

Que exista una cita no demuestra que respalde correctamente la afirmación.

Validación fuerte.

 

10.6 Source ≠ Source Authority

Una fuente puede identificarse objetivamente.

Su autoridad necesita evaluación.

Validación fuerte.

 

10.7 Visibility ≠ Accuracy

Una entidad puede aparecer claramente y, sin embargo, estar representada incorrectamente.

Validación conceptual y empírica suficiente para mantener la distinción.

 

10.8 Cross-Model Coverage ≠ Presence

Presence es una observación por respuesta.

Coverage necesita múltiples engines.

Validación fuerte.

 

11. Hallazgo emergente: Entity Resolution

Este es probablemente el hallazgo más importante que no estaba suficientemente explicitado en OVF 0.1.

P01 demuestra que existe una diferencia entre:

String Recognition

El sistema reconoce la secuencia «AVM».

Entity Recognition

El sistema reconoce que existe una entidad asociada.

Entity Resolution

El sistema determina qué entidad concreta es.

Category Assignment

El sistema determina a qué categoría pertenece.

Attribution

El sistema determina quién la creó/desarrolló/representa.

El experimento demuestra que estos pasos pueden divergir.

Por tanto, P01 no es simplemente una prueba de Recognition.

Es una prueba de que:

la ambigüedad de entidad es una condición fundamental de la medición de AI Visibility.

La documentación experimental ya había llegado a esta observación al señalar explícitamente el fenómeno de desambiguación y la diferencia entre AVM™ como AI Visibility Model y otros significados de AVM.

 

12. Hallazgo estructural: observable ≠ evaluated ≠ derived

El experimento obliga a separar tres niveles.

 

Nivel 1 — Observable

Puede registrarse directamente.

Ejemplos:

Presence

Recognition

Category

Mention

Recommendation

Citation

Source

 

Nivel 2 — Evaluated

Necesita criterio externo.

Ejemplos:

Accuracy

Recommendation Quality

Source Authority

Source Fidelity

 

Nivel 3 — Derived

Necesita múltiples observaciones.

Ejemplos:

Frequency

Mention Rate

Coverage

SOV

Agreement

Consistency

Volatility

 

Esta separación constituye uno de los resultados metodológicos más importantes del experimento.

 

13. Contexto experimental

El experimento también demuestra que la respuesta no puede interpretarse independientemente de las condiciones bajo las cuales se obtuvo.

Las propias respuestas señalan:

diferencias entre plataformas;

estocasticidad;

variabilidad temporal;

diferencias de recuperación;

idioma;

ubicación;

sesión.

 

Gemini señala explícitamente que la misma consulta puede producir respuestas diferentes según sesión, ubicación, idioma o actualización del modelo.

Claude señala asimismo que la reproducibilidad requiere registrar:

prompt;

modelo;

versión;

fecha;

muestra;

plataforma;

repeticiones.

 

Por tanto:

Context y Experimental Metadata no son información secundaria. Son condiciones de interpretación de la observación.

 

14. Retrieval Mode como factor experimental

El experimento presenta además una dificultad importante:

no todas las respuestas se obtuvieron necesariamente bajo idénticas condiciones de recuperación.

En el corpus aparecen respuestas con:

web search;

fuentes;

URLs;

referencias;

respuestas sin recuperación equivalente.

 

Esto afecta especialmente a:

Citation;

Source;

Source Fidelity;

posiblemente Representation.

 

Conclusión

El modo de recuperación debe quedar registrado como condición experimental.

No se clasifica todavía como métrica de AI Visibility.

 

15. Limitaciones del experimento

 

15.1 Número de ejecuciones

Cada prompt no fue repetido sistemáticamente múltiples veces.

Por tanto, no podemos estimar:

distribución;

varianza;

volatilidad;

consistencia intra-modelo;

intervalos de confianza.

 

15.2 Perplexity incompleto

Perplexity dispone de P01–P11.

Por tanto:

las comparaciones Cross-Model P12–P20 no incluyen los cuatro sistemas.

 

15.3 Versionado de modelos

El dataset no proporciona en todos los casos un registro homogéneo y estructurado de:

modelo;

versión exacta;

fecha;

configuración.

 

Esto limita la reproducibilidad exacta.

 

15.4 Retrieval heterogéneo

Los sistemas no operan necesariamente bajo idéntico régimen de recuperación.

Esto impide interpretar Citation y Source como si fueran observaciones generadas bajo condiciones experimentales perfectamente equivalentes.

 

15.5 Corpus pequeño

20 prompts constituyen un buen experimento exploratorio, pero no un benchmark estadístico definitivo.

El objetivo del experimento era descubrir variables, no producir una estimación poblacional de AI Visibility.

 

15.6 Entity-specific experiment

El experimento está centrado en AVM™ y su ecosistema semántico.

Por tanto, no demuestra todavía que todas las variables se comporten idénticamente con:

marcas comerciales;

productos;

organizaciones;

personas;

conceptos;

entidades ambiguas;

entidades no ambiguas.

 

16. Qué NO puede concluir este experimento

Este documento no demuestra:

❌ cuál es el mejor modelo;

❌ cuál tiene mayor AI Visibility;

❌ cuál tiene mayor accuracy global;

❌ cuál tiene mayor Citation Rate;

❌ cuál tiene mayor Recommendation Rate;

❌ cuál tiene mayor consistencia;

❌ qué ponderación debe utilizar AVM™;

❌ cuál debe ser el AVM™ Score;

❌ qué dimensiones deben tener mayor peso;

❌ que AVM™ sea todavía un estándar universal;

❌ que las variables observadas sean definitivas.

Estas cuestiones quedan deliberadamente fuera del alcance.

 

17. Qué sí demuestra razonablemente el experimento

El experimento proporciona evidencia para afirmar que:

1. AI Visibility es multidimensional.

2. Presence no describe por sí sola la representación de una entidad.

3. Recognition y Entity Resolution pueden divergir.

4. Recognition y Attribution pueden divergir.

5. Mention y Recommendation son fenómenos diferentes.

6. Recommendation y Recommendation Quality requieren tratamientos epistemológicos diferentes.

7. Citation y Citation Validity son diferentes.

8. Source y Source Authority son diferentes.

9. Accuracy requiere un criterio externo.

10. Cross-Model Coverage es derivada.

11. Cross-Model Agreement no equivale a Intra-Model Consistency.

12. Volatility y Persistence requieren experimentación longitudinal.

13. La ambigüedad de entidad es una variable fundamental del problema.

14. El contexto de consulta y las condiciones de ejecución afectan la interpretación.

 

18. Registro de decisiones metodológicas

Decisión Motivo Resultado
Mantener Raw Response Trazabilidad Confirmada
No calcular Score Evitar ponderaciones prematuras Confirmada
Separar Observable/Evaluated Diferente naturaleza epistemológica Confirmada
Separar Observable/Derived Evitar confundir observación con agregación Confirmada
No tratar Frequency como variable Requiere agregación Adoptada
No tratar Coverage como variable primaria Requiere varios engines Adoptada
No tratar Accuracy como observable puro Requiere referencia Adoptada
No tratar Source Authority como observable Requiere evaluación Adoptada
No validar Volatility Falta repetición Pendiente
No validar Persistence Falta serie temporal Pendiente
No validar Absorption Falta inferencia causal Pendiente
No validar Influence Falta comportamiento de usuario Pendiente
Registrar Retrieval Mode Condición experimental relevante Adoptada
Separar Cross-Model Agreement de Consistency Fenómenos diferentes Adoptada como hallazgo
Tratar Entity Resolution como fenómeno emergente Evidencia P01–P04 Registrada como hallazgo

 

 

19. Registro de estado de las afirmaciones de OVF 0.1

Para evitar ambigüedad terminológica, se utilizan seis estados:

VALIDATED

La evidencia permite mantener la afirmación en su forma general.

PARTIALLY VALIDATED

El fenómeno existe, pero la formulación original necesita precisión.

DERIVED

No es una observación primaria; se calcula a partir de observaciones.

EVALUATED

Requiere referencia, criterio o juicio externo.

NOT VALIDATED

El experimento no permite comprobarlo.

FALSIFIED

La formulación original no resiste la evidencia observada.

 

20. Resultado consolidado

🟢 VALIDATED

Presence

Recognition

Category

Attribution

Recommendation

Citation

Source

Context

 

🟡 PARTIALLY VALIDATED

Mention

Position

Prominence

Recommendation Position

Methodology Recognition

Competitive Presence

Competitive Position

 

🔵 DERIVED

Frequency

Mention Rate

Recommendation Rate

Engine Coverage

Cross-Model Agreement

SOV

 

🟠 EVALUATED

Accuracy

Recommendation Quality

Attribution Accuracy

Source Authority

Source Fidelity

Citation Validity

 

⚪ NOT VALIDATED

Intra-Model Consistency

Volatility

Persistence

Absorption

Influence

 

🔴 FALSIFIED AS PRIMARY OBSERVABLE

Frequency como variable primaria

Engine Coverage como variable primaria

Position como ranking universal

Accuracy como observable directo

Source Authority como observable directo

 

21. Hallazgo principal del experimento

La evidencia acumulada permite reformular el problema de AI Visibility.

La pregunta inicial podía expresarse como:

¿Aparece una marca en una respuesta de IA?

El experimento demuestra que esta pregunta es insuficiente.

Una representación generativa puede requerir distinguir, como mínimo:

¿Qué entidad ha reconocido el sistema?

¿La ha resuelto correctamente?

¿La ha situado en la categoría correcta?

¿La ha atribuido correctamente?

¿La ha hecho presente?

¿Cómo la representa?

¿La recomienda?

¿Con qué prominencia?

¿Qué evidencia utiliza?

¿Esta representación es correcta?

¿Se comporta igual en otros sistemas?

Y, posteriormente:

¿Se mantiene estable cuando repetimos el experimento?

 

22. Conclusión experimental

El experimento no confirma OVF 0.1 como taxonomía definitiva.

Eso no constituye un fracaso.

Es precisamente el resultado que se buscaba.

OVF 0.1 ha funcionado como una hipótesis de observación y el experimento ha permitido someter sus componentes a evidencia empírica.

El proceso ha producido tres tipos de resultados:

A. Variables que sobreviven

Algunas variables se muestran claramente observables y codificables.

B. Variables que deben cambiar de naturaleza

Algunas no son observaciones primarias sino:

evaluaciones;

métricas derivadas;

variables contextuales.

C. Fenómenos todavía no demostrados

Otros requieren nuevos diseños experimentales:

repetición;

longitudinalidad;

causalidad;

comportamiento del usuario.

 

El resultado más significativo es que el experimento revela una estructura más compleja que una simple métrica de presencia:

la visibilidad generativa implica no solamente aparición, sino resolución, reconocimiento, categorización, atribución, representación, recomendación y evidencia.

La evidencia P01–P20 demuestra además que estos fenómenos pueden divergir entre sistemas, incluso cuando reciben consultas equivalentes.

Por tanto, el experimento respalda provisionalmente la tesis fundamental que motivó OVF:

AI Visibility no debe reducirse a la frecuencia de menciones.

Pero también introduce una cautela esencial:

no todo fenómeno relacionado con AI Visibility puede tratarse como una variable observable primaria.

La arquitectura de medición debe distinguir rigurosamente entre:

observación → codificación → evaluación → métrica derivada → comportamiento Cross-Model → comportamiento temporal.

 

23. Estado del proyecto tras el experimento

El estado documental queda cerrado, deliberadamente, en:

OVF 0.1

CROSS-MODEL EXPERIMENT

P01–P20

VALIDATION AUDIT

├── VALIDATED

├── PARTIALLY VALIDATED

├── DERIVED

├── EVALUATED

├── NOT VALIDATED

└── FALSIFIED

Este documento no introduce OVF 0.2.

La revisión del framework constituye una fase posterior y deberá partir de este registro experimental, no modificar retrospectivamente sus resultados.

 

24. Registro de integridad del experimento

Para preservar la trazabilidad:

Dataset utilizado: respuestas originales P01–P20 disponibles para ChatGPT, Gemini y Claude; P01–P11 para Perplexity.

Número de respuestas: 71.

Corpus: 20 prompts oficiales.

Unidad primaria de análisis: respuesta individual de un sistema ante un prompt.

Unidad secundaria: comparación Cross-Model.

No se han realizado: ponderaciones, scoring, normalización de AVM Score ni selección definitiva de dimensiones.

Limitación principal: ausencia de repetición sistemática y cobertura incompleta de Perplexity.

Resultado: evidencia exploratoria suficiente para auditar y revisar OVF 0.1, pero insuficiente para establecer todavía un estándar cuantitativo definitivo.

 

Declaración final del documento

Este informe constituye el registro de la primera prueba empírica de AVM™ sobre su propio marco de variables observables.

Las variables no han sido consideradas válidas por haber sido propuestas previamente; han sido sometidas a evidencia.

Cuando la evidencia ha respaldado una afirmación, se registra como validada. Cuando ha obligado a modificar su interpretación, se registra como parcialmente validada. Cuando ha demostrado que una variable es derivada o evaluativa, se reclasifica. Cuando el experimento no permite comprobar una afirmación, se registra como no validada. Y cuando la formulación original no resiste la evidencia, se registra como falsada.

El siguiente desarrollo de AVM™ deberá construirse sobre este registro, no sobre las hipótesis originales.

 

Fuentes experimentales primarias

Los datos de este informe proceden de los documentos originales del experimento: 20 prompts oficiales ChatGPT, 20 prompts oficiales Gemini, 20 prompts oficiales Claude, 20 prompts oficiales Perplexity y el documento de desarrollo de OVF 0.1. Las respuestas y el marco metodológico permanecen como materiales primarios de referencia. Por ejemplo, el corpus de Claude conserva desde P01 la respuesta completa y la identificación de AI Visibility Model frente a otros significados de AVM. El corpus de Gemini documenta directamente la desambiguación de AVM, la posterior identificación de AI Visibility Model y las diferencias de comportamiento metodológico entre plataformas. El documento OVF 0.1 establece expresamente el examen de observabilidad, definición, codificación, reproducibilidad y comparabilidad utilizado en esta auditoría.

Documento cerrado en esta fase. No se adelanta OVF 0.2.

 

Manu Duque
AI Visibility Specialist
ai-visibility.es

Las 8 mejores APIs de SEO en 2026

  Una API de SEO permite consultar datos de posiciones, palabras clave, backlinks o resultados de búsqueda desde tu propio código: envías una petición a un endpoint y recibes JSON estructurado, sin pasar por el

Leer más »
Manu Duque
Resumen de privacidad

Esta web utiliza cookies para que podamos ofrecerte la mejor experiencia de usuario posible. La información de las cookies se almacena en tu navegador y realiza funciones tales como reconocerte cuando vuelves a nuestra web o ayudar a nuestro equipo a comprender qué secciones de la web encuentras más interesantes y útiles.

Nunca almacenamos información personal.

Puedes revisar nuestra política en la página de Política de Privacidad, Condiciones de Uso y Cookies.