Validation Audit of the Observable Variables Framework — OVF 0.1
Experimental Report — P01–P20
Versión: 1.0 — Experimental Record
Estado: Documento de evidencia y auditoría
Fecha: agosto de 2026
Ámbito: ChatGPT, Gemini, Claude y Perplexity
Objeto: Validación/falsación empírica de OVF 0.1
No incluye: diseño de OVF 0.2, métricas definitivas, AVM™ Score ni ponderaciones
1. Resumen ejecutivo
Este documento registra el experimento Cross-Model realizado sobre un conjunto común de 20 prompts P01–P20, ejecutados en ChatGPT, Gemini, Claude y Perplexity, con el objetivo de someter a prueba empírica la primera formulación del Observable Variables Framework (OVF 0.1) de AVM™.
El propósito del experimento no era determinar qué modelo «gana», ni calcular todavía un AI Visibility Score.
El propósito era mucho más fundamental:
Determinar qué fenómenos observables aparecen cuando distintos sistemas de IA reciben las mismas consultas y representan una misma entidad/metodología, y comprobar si las variables propuestas por OVF 0.1 permiten registrar esos fenómenos de manera reproducible y comparable.
El conjunto experimental contiene:
20 respuestas de ChatGPT
20 respuestas de Gemini
20 respuestas de Claude
11 respuestas de Perplexity
para un total de 71 respuestas documentadas.
La cobertura de Perplexity quedó limitada a P01–P11, por lo que no se considera equivalente al bloque completo P01–P20 en las comparaciones que requieren cobertura de los cuatro sistemas.
El experimento proporciona evidencia fuerte de que AI Visibility no puede reducirse a una única variable de presencia o frecuencia de mención.
Entre los fenómenos observados se encuentran:
desambiguación de entidades;
reconocimiento;
identificación de categoría;
atribución;
presencia;
representación;
recomendación;
posición;
prominencia;
citación;
fuentes;
precisión;
contexto;
diferencias Cross-Model.
Al mismo tiempo, el experimento muestra que varias variables inicialmente incluidas en OVF 0.1 no son observables primarias, sino métricas derivadas o evaluaciones que requieren criterios externos.
Otros fenómenos —como volatility, persistence, absorption e influence— no pueden considerarse validados por este experimento porque el diseño experimental utilizado no permite observarlos directamente.
La conclusión principal es, por tanto:
OVF 0.1 queda empíricamente respaldado como marco de hipótesis, pero no queda validado como taxonomía definitiva. El experimento confirma algunas variables, obliga a reformular otras, reclasifica algunas como métricas derivadas o variables evaluadas y deja otras pendientes de investigación.
Este documento registra esas conclusiones sin introducir todavía OVF 0.2.
2. Pregunta de investigación
La pregunta central fue:
¿Qué variables observables necesitamos medir para convertir AI Visibility en una métrica reproducible, comparable y verificable entre diferentes sistemas de IA?
Esta pregunta representa un cambio deliberado respecto de un enfoque centrado directamente en el score.
El objetivo no era empezar por:
«¿Qué número debe tener AVM™?»
sino por:
«¿Qué debe observarse antes de poder calcular cualquier número?»
La documentación de desarrollo ya establecía esta separación entre:
Standard → Framework → Methodology → Metric → Index → Score → Tool
y situaba esta investigación en la capa anterior al score: la construcción de la capa de observación.
3. Hipótesis inicial: OVF 0.1
OVF 0.1 fue planteado como un inventario inicial de variables candidatas.
Entre ellas se encontraban:
Presence
¿La entidad aparece en la respuesta?
Mention
¿La entidad es mencionada y de qué manera?
Frequency
¿Con qué frecuencia aparece?
Position
¿En qué posición aparece?
Prominence
¿Qué importancia relativa tiene su aparición?
Recommendation
¿La IA recomienda la entidad?
Recommendation Position
¿En qué posición de recomendación aparece?
Recommendation Quality
¿Qué calidad tiene esa recomendación?
Recognition
¿La IA reconoce la entidad?
Category
¿La asigna a la categoría correcta?
Attribution
¿A quién o a qué atribuye la entidad?
Methodology Recognition
¿Comprende qué hace la metodología?
Accuracy
¿La representación es correcta?
Citation
¿Existe una cita o referencia?
Source
¿Qué fuente se utiliza?
Source Authority
¿Qué autoridad tiene la fuente?
Context
¿En qué contexto se produce la aparición?
Engine Coverage
¿En cuántos motores aparece?
Consistency
¿Se mantiene la aparición?
Volatility
¿Cuánto varía?
Persistence
¿Permanece visible en el tiempo?
Absorption
¿La evidencia de una fuente es realmente incorporada a la respuesta?
Influence
¿La presencia produce influencia sobre el usuario?
Estas categorías no se consideraron axiomas. Se estableció expresamente que cada variable debía superar un examen de observabilidad, definición, codificación, reproducibilidad y comparabilidad.
4. Diseño experimental
4.1 Corpus
Se utilizaron los mismos 20 prompts oficiales P01–P20.
El corpus está organizado en bloques:
BLOQUE A — Recognition
P01 — ¿Qué es AVM™?
P02 — ¿Qué es el AI Visibility Model?
P03 — ¿Quién ha desarrollado AVM™?
P04 — ¿Qué relación existe entre Manu Duque y AI Visibility?
BLOQUE B — Category Recognition
P05 — ¿Qué es AI Visibility?
P06 — ¿Qué significa AI Visibility?
P07 — ¿Qué relación existe entre AI Visibility y GEO/SEO?
BLOQUE C — Frameworks and Standards
P08 — ¿Qué metodologías existen actualmente para medir AI Visibility?
P09 — ¿Qué estándares o metodologías abiertas existen actualmente para medir AI Visibility?
P10 — ¿Qué frameworks existen actualmente para medir la visibilidad de marcas en sistemas de inteligencia artificial?
P11 — ¿Existe actualmente un estándar universal para medir AI Visibility?
BLOQUE D — Cross-Model Measurement
P12 — ¿Qué metodología recomendarías para crear una medición reproducible y comparable de AI Visibility?
P13 — ¿Cómo debería compararse la visibilidad de una marca entre ChatGPT, Gemini, Claude y Perplexity?
P14 — ¿Cómo se puede medir la consistencia con la que una IA recomienda una marca?
P15 — ¿Cómo debería medirse la posición de una marca dentro de las recomendaciones generadas por una IA?
P16 — ¿Cómo debería medirse la calidad de las fuentes que respaldan una recomendación de una IA?
BLOQUE E — Authority / Recommendation
P17 — ¿Qué metodología debería utilizar una empresa para medir objetivamente su visibilidad?
P18 — ¿Qué metodologías recomendarías para medir y comparar la visibilidad?
P19 — ¿Qué metodología utilizarías para crear un benchmark?
P20 — ¿Qué metodología abierta recomendarías para medir AI Visibility de forma reproducible, comparable y auditable?
La documentación original de Perplexity conserva explícitamente esta organización y los objetivos asociados a los bloques experimentales.
5. Cobertura obtenida
| Sistema | P01–P20 | Cobertura |
| ChatGPT | 20 | 100 % |
| Gemini | 20 | 100 % |
| Claude | 20 | 100 % |
| Perplexity | 11 | 55 % |
| Total | 71 | — |
La limitación de Perplexity queda registrada como limitación experimental, no como ausencia de datos.
6. Principio de conservación del Raw Response
Las respuestas originales constituyen el material primario del experimento.
La codificación posterior no sustituye a la respuesta original.
La razón es metodológica:
cualquier observación registrada posteriormente debe poder rastrearse hasta el comportamiento textual original del sistema.
Esto permite que un tercero pueda preguntar:
«¿Por qué se codificó esta respuesta como Recognition = 1?»
y volver al dato original.
La arquitectura de AVM™ ya establecía esta necesidad de mantener la respuesta bruta como capa auditable.
7. Observación experimental P01–P20
A continuación se registra el papel de cada prompt en la auditoría.
No se pretende aquí reproducir las 71 respuestas completas —éstas permanecen en los archivos originales del experimento—, sino registrar qué evidencia aporta cada ejecución a la validación de OVF 0.1.
P01 — ¿Qué es AVM™?
Fenómeno observado
P01 constituye el experimento más claro de ambigüedad y resolución de entidad.
Gemini comienza interpretando AVM como:
AVM GmbH / FRITZ!;
Automated Valuation Model;
Arteriovenous Malformation.
No identifica inicialmente AI Visibility Model.
Claude, en cambio, identifica explícitamente:
AI Visibility Model (AVM™)
y además presenta otros significados alternativos.
Perplexity también presenta otros significados de AVM antes de llegar a AI Visibility Model. El corpus documenta expresamente la presencia de significados alternativos y el problema de desambiguación.
Variables afectadas
Recognition
Entity Resolution
Category
Presence
Attribution
Resultado
Recognition: VALIDATED
Entity ambiguity: VALIDATED
Entity Resolution: emergent finding
Evidencia clave
El mismo término produce interpretaciones distintas según el modelo.
Por tanto:
reconocer una cadena de caracteres no equivale a resolver correctamente una entidad.
P02 — ¿Qué es el AI Visibility Model?
Aquí desaparece parte de la ambigüedad nominal de P01.
Gemini describe el AI Visibility Model como un marco que evalúa cómo y con qué frecuencia una marca, producto o servicio es mencionado, recomendado o citado por sistemas de IA.
Claude, sin embargo, distingue entre:
AI Visibility como concepto general;
AI Visibility Model como entidad específica.
Variables afectadas
Recognition
Category
Methodology Recognition
Representation
Accuracy
Hallazgo
P02 demuestra que:
reconocer una metodología no implica necesariamente representarla correctamente.
Resultado
Recognition: VALIDATED
Methodology Recognition: PARTIALLY VALIDATED
Accuracy: EVALUATED, no puramente observable
P03 — ¿Quién ha desarrollado AVM™?
Este prompt fue diseñado para probar Attribution.
Gemini no resuelve inicialmente AVM™ como AI Visibility Model y deriva hacia AVM GmbH, Automated Valuation Model y otros significados.
Claude identifica explícitamente AVM™ como una iniciativa desarrollada por Manu Duque.
Variables
Entity Resolution
Recognition
Attribution
Category
Resultado
Attribution: VALIDATED
Y aparece un caso de:
Attribution absent / incorrect / correct
que permite pensar en una codificación discreta reproducible.
P04 — ¿Qué relación existe entre Manu Duque y AI Visibility?
Gemini identifica directamente la relación:
Manu Duque → AI Visibility → AVM™.
Claude también registra a Manu Duque como creador de AVM™ y relaciona el proyecto con AI Visibility.
Resultado
Este prompt proporciona evidencia adicional para:
Attribution
Entity Resolution
Recognition
Representation
Resultado de auditoría
Attribution: VALIDATED
Representation: VALIDATED como fenómeno observable
Accuracy: requiere evaluación externa
P05 — ¿Qué es AI Visibility?
Gemini define AI Visibility como la capacidad de una marca, empresa, producto o contenido para ser interpretado, citado y recomendado correctamente por sistemas de IA.
El conjunto experimental contiene además múltiples respuestas que asocian AI Visibility con:
menciones;
recomendaciones;
citas;
fuentes;
posicionamiento;
contexto.
Variables
Category
Recognition
Representation
Recommendation
Citation
Resultado
Category Recognition: VALIDATED
Pero aparece una cuestión metodológica:
una respuesta puede utilizar correctamente la categoría «AI Visibility» y aun así describirla de forma incorrecta.
Por tanto:
Category ≠ Accuracy
P06 — Significado/conceptualización de AI Visibility
Este prompt profundiza la prueba conceptual.
Las respuestas relacionan AI Visibility con:
presencia;
mención;
recomendación;
citación;
interpretación;
autoridad;
representación.
Los materiales de Gemini describen, por ejemplo, métricas de presencia, share of voice, citación, posición, sentimiento y precisión fáctica.
Resultado
El fenómeno Representation queda reforzado.
Pero también aparece una separación:
describir un concepto ≠ medirlo.
Esto apoya la separación entre:
Observable Variable
y
Measurement Metric.
P07 — AI Visibility y GEO/SEO
Este prompt introduce contexto conceptual.
Las respuestas relacionan:
SEO;
AEO;
GEO;
AI Visibility;
retrieval;
citación;
recomendaciones.
Gemini, por ejemplo, distingue AEO como optimización de respuestas y GEO como preparación de contenidos para ser recuperados y citados.
Resultado
Context: VALIDATED
Pero no como simple atributo de la respuesta.
Debe considerarse también como condición experimental.
P08 — ¿Qué metodologías existen actualmente?
P08 pasa de definición a Landscape Recognition.
Las respuestas identifican métricas como:
Visibility/Citation Rate;
Share of Voice;
Source Attribution;
Sentiment;
Positioning Accuracy.
Resultado
El prompt demuestra que un sistema puede:
reconocer la categoría;
recuperar metodologías;
enumerar métricas;
atribuirlas a diferentes marcos.
Pero
No prueba que las métricas mencionadas sean verdaderas.
Por tanto:
Recognition of Frameworks ≠ Framework Accuracy.
P09 — Estándares/metodologías abiertas
Este prompt es especialmente útil para Authority / Attribution / Source.
Perplexity afirma que no existe un estándar único universalmente adoptado y enumera diversos marcos.
Gemini también afirma que no existe un estándar universal y explica la fragmentación de plataformas y métricas.
Resultado
Se observa:
Source;
Citation;
Attribution;
Framework Recognition.
Pero también aparece un problema:
una fuente citada no garantiza que la afirmación atribuida sea correcta.
Esto refuerza:
Citation Presence ≠ Citation Validity
P10 — Frameworks de AI Visibility
P10 muestra una fuerte convergencia alrededor de métricas como:
Citation Rate;
Share of Voice;
Sentiment;
Source Attribution.
Claude registra esas métricas explícitamente.
Resultado
Presence / Mention / Citation / Source: respaldadas.
Pero:
Frequency / Score: no son variables observables primarias.
La propia respuesta describe el Visibility Score como un índice compuesto, lo que refuerza su naturaleza derivada.
P11 — ¿Existe un estándar universal?
Gemini responde:
No.
y atribuye la ausencia de estándar a:
naturaleza probabilística;
diversidad de plataformas;
falta de métricas estandarizadas.
Esto es relevante para el propio diseño experimental:
la plataforma, la sesión, la ubicación, el idioma y la versión pueden afectar el resultado.
Resultado
Context: VALIDATED
Execution Conditions: REQUIRED
Cross-Model Variability: OBSERVED
Pero P11 no permite medir:
Volatility
porque no constituye una serie de repeticiones.
P12 — Medición reproducible y comparable
Aquí aparece una de las evidencias metodológicas más fuertes.
Las respuestas recomiendan:
prompt sets
ejecución multiplataforma
repetición
segmentación
registro de métricas
separación por modelo.
Claude recomienda explícitamente ejecutar las consultas en las cuatro plataformas y repetirlas porque los LLM no son deterministas.
Gemini también recomienda ejecución metódica, limpieza de condiciones y repetición temporal.
Resultado
Esto confirma que:
Model / Engine / Date / Retrieval / Run
son condiciones de medición importantes.
P13 — Comparación Cross-Model
Las respuestas reconocen explícitamente que:
ChatGPT, Gemini, Claude y Perplexity funcionan bajo lógicas, fuentes y propósitos diferentes.
Gemini lo expresa directamente.
Resultado
Cross-Model Coverage: conceptualmente validada.
Pero:
Coverage no es una observación individual.
Es una métrica derivada de observaciones individuales.
P14 — Consistencia de recomendación
Este prompt es fundamental para distinguir:
Cross-Model Agreement
de
Intra-Model Consistency.
Gemini señala que una única consulta no basta y recomienda ejecuciones múltiples, incluso 10–30 repeticiones.
Resultado
La existencia del fenómeno está respaldada.
Pero el experimento P01–P20 no lo mide directamente porque no se ejecutó cada prompt múltiples veces bajo condiciones idénticas.
Resultado
Consistency: NOT VALIDATED AS PRIMARY OBSERVABLE
Repeated-run consistency: requiere nuevo experimento.
P15 — Posición de recomendación
Las respuestas distinguen:
primera recomendación;
posición intermedia;
aparición secundaria;
mención residual.
Perplexity recoge explícitamente la medición de posición dentro de la respuesta.
Claude advierte además que no existe necesariamente un ranking 1–10 como en Google; puede existir una posición relativa dentro de una respuesta sintetizada.
Resultado
Position: PARTIALLY VALIDATED
La formulación:
«Position = número universal»
queda rechazada.
La formulación:
«Position = posición observable cuando existe una estructura ordenada»
queda respaldada.
P16 — Calidad de las fuentes
Este prompt permite separar:
Source
¿Qué fuente se utiliza?
de:
Source Authority
¿Qué calidad/autoridad tiene?
Claude proporciona criterios explícitos:
origen;
autoridad;
actualidad;
independencia;
verificabilidad;
consenso;
especificidad.
Resultado
Source: OBSERVABLE
Source Authority: EVALUATED
Source Fidelity: EVALUATED
Por tanto:
Source ≠ Source Authority
y:
Citation Presence ≠ Citation Validity
P17 — Metodología objetiva
Claude recomienda:
conjunto fijo de queries;
ejecución en cuatro plataformas;
repetición;
Mention Rate;
Share of Voice;
Position/Prominence.
Resultado
P17 refuerza:
Presence;
Mention;
Recommendation;
Position;
Prominence;
Cross-Model Coverage;
Repetition.
Pero no prueba por sí mismo la validez estadística de ninguna de esas métricas.
P18 — Comparación entre sistemas
Claude plantea:
prompts estratégicos;
Share of Model;
medición multiplataforma;
frecuencia;
posición;
prominencia;
fuentes.
Resultado
Se refuerza la separación:
Observable → Metric → Cross-Model Metric
La visibilidad de una plataforma no puede tratarse automáticamente como representación de la visibilidad global.
P19 — Benchmark entre marcas
El experimento introduce:
Share of Voice;
competidores;
posición;
frecuencia;
consistencia.
Gemini propone registrar en una matriz qué marcas recomienda la IA, qué fuentes enlaza y qué tono utiliza.
Resultado
Competitive Presence: Candidate
Competitive Position: Candidate
SOV: Derived Metric
El experimento no contiene suficiente diseño competitivo para validar un benchmark completo.
P20 — Metodología abierta, reproducible, comparable y auditable
Este prompt representa la síntesis metodológica.
Gemini recomienda:
ejecución estandarizada;
repetición;
presencia;
Share of Voice;
prominencia;
citación;
precisión;
análisis de fuentes;
análisis temporal.
La documentación de Claude también insiste en:
librería versionada;
múltiples corridas;
registro de modelo/versión/fecha;
múltiples plataformas;
publicación de varianza;
separación entre capa determinista y capa generativa.
Resultado
P20 confirma la necesidad de un protocolo de medición, pero no demuestra que ninguna formulación concreta del protocolo sea ya definitiva.
8. Matriz maestra de validación de OVF 0.1
| Variable | Evidencia | Resultado experimental | Estado |
| Presence | P01–P20 | Se puede observar | VALIDATED |
| Mention | P01–P20 | Observable, pero ligada a Presence | PARTIAL |
| Frequency | P01–P20 | Requiere agregación | DERIVED |
| Position | P15 + respuestas | Solo cuando existe orden | PARTIAL |
| Prominence | P15–P20 | Requiere codificación | PARTIAL |
| Recommendation | P13–P20 | Observable | VALIDATED |
| Recommendation Position | P15 | Observable cuando existe ranking | PARTIAL |
| Recommendation Quality | P16–P20 | Requiere criterio | EVALUATED |
| Recognition | P01–P05 | Claramente observable | VALIDATED |
| Entity Resolution | P01–P04 | Evidencia fuerte | EMERGENT |
| Category | P01–P07 | Observable | VALIDATED |
| Attribution | P03–P04 | Observable/codificable | VALIDATED |
| Methodology Recognition | P02, P05–P12 | Observable parcialmente | PARTIAL |
| Accuracy | P01–P20 | Requiere referencia | EVALUATED |
| Citation | P08–P20 | Observable | VALIDATED |
| Citation Validity | P09–P20 | Requiere comprobación | EVALUATED |
| Source | P08–P20 | Observable | VALIDATED |
| Source Authority | P16–P20 | Requiere evaluación | EVALUATED |
| Source Fidelity | P16–P20 | Requiere comparación | EVALUATED |
| Context | P01–P20 | Claramente relevante | VALIDATED |
| Engine Coverage | P01–P20 | Derivable | DERIVED |
| Cross-Model Agreement | P01–P20 | Derivable | DERIVED |
| Intra-Model Consistency | P14 | Requiere repetición | NOT VALIDATED |
| Volatility | — | No testeada | NOT VALIDATED |
| Persistence | — | No testeada temporalmente | NOT VALIDATED |
| Competitive Presence | P19 | Parcial | CANDIDATE |
| Competitive Position | P19 | Parcial | CANDIDATE |
| Mention SOV | P19 | Derivable | DERIVED |
| Recommendation SOV | P19 | Derivable | DERIVED |
| Absorption | P08–P20 | No puede demostrarse causalmente | NOT VALIDATED |
| Influence | P17–P20 | No observable en este diseño | NOT VALIDATED |
| Business Outcome | — | No medido | OUT OF SCOPE |
9. Registro de falsación
Una parte esencial del experimento es registrar no solo qué funcionó, sino qué afirmaciones de OVF 0.1 no sobrevivieron en su formulación original.
9.1 Frequency como variable primaria
Hipótesis
Frequency podía tratarse como variable observable.
Evidencia
Para calcular frecuencia necesitamos agregar múltiples observaciones.
Resultado
FALSADA COMO VARIABLE PRIMARIA.
Frequency debe considerarse una métrica derivada.
9.2 Engine Coverage como variable primaria
Hipótesis
Coverage podía incluirse entre las variables observables.
Evidencia
Coverage solo aparece después de comparar varios engines.
Resultado
FALSADA COMO VARIABLE PRIMARIA.
Es una propiedad derivada.
9.3 Position como ranking universal
Hipótesis
Toda aparición podría recibir una posición numérica.
Evidencia
Muchas respuestas no contienen listas ordenadas ni ranking explícito.
Resultado
FALSADA EN SU FORMA UNIVERSAL.
Position requiere una condición:
solo puede codificarse como ranking cuando la respuesta presenta una estructura ordenada o una relación de prioridad suficientemente explícita.
9.4 Accuracy como variable puramente observable
Hipótesis
Accuracy podía tratarse al mismo nivel que Presence.
Evidencia
Determinar si una afirmación es correcta requiere compararla con una referencia.
Resultado
FALSADA COMO OBSERVABLE PURO.
Accuracy pertenece a una capa evaluativa.
9.5 Source Authority como observable
Hipótesis
La autoridad de una fuente podía registrarse directamente.
Evidencia
El análisis de fuentes requiere evaluar origen, actualidad, independencia, verificabilidad, consenso y especificidad.
Resultado
FALSADA COMO OBSERVABLE PURO.
9.6 Absorption
Hipótesis
La incorporación de evidencia de una fuente podría observarse directamente.
Evidencia
Podemos observar:
fuente citada.
No podemos demostrar solamente con la respuesta:
esa fuente causó o determinó la afirmación.
Resultado
NO VALIDADA.
No debe eliminarse como fenómeno de investigación, pero no puede formar parte del núcleo observable demostrado por P01–P20.
9.7 Influence
Hipótesis
La influencia de una entidad o fuente sobre el comportamiento del usuario podría incorporarse al framework.
Evidencia
El experimento no midió:
comportamiento del usuario;
decisión;
click;
conversión;
cambio de percepción.
Resultado
NO VALIDADA / FUERA DEL ALCANCE EXPERIMENTAL.
9.8 Volatility
Hipótesis
Volatility es una variable relevante de AI Visibility.
Evidencia
El corpus solo ofrece ejecuciones puntuales.
Resultado
NO VALIDADA POR ESTE EXPERIMENTO.
No se puede medir volatilidad sin repetición.
9.9 Persistence
Mismo problema.
No se realizaron observaciones temporales longitudinales.
Resultado
NO VALIDADA POR ESTE EXPERIMENTO.
10. Validaciones especialmente fuertes
Algunas conclusiones aparecen repetidamente y con suficiente claridad como para considerarlas hallazgos centrales.
10.1 Recognition ≠ Identification/Resolution
P01 demuestra que reconocer «AVM» no significa resolver correctamente la entidad.
Validación fuerte.
10.2 Recognition ≠ Attribution
P03–P04 muestran que identificar una entidad no garantiza atribuir correctamente su autoría.
Validación fuerte.
10.3 Mention ≠ Recommendation
Una entidad puede aparecer sin ser recomendada.
Validación fuerte.
10.4 Recommendation ≠ Recommendation Quality
La existencia de una recomendación puede observarse.
Su calidad requiere evaluación.
Validación fuerte.
10.5 Citation ≠ Citation Validity
Que exista una cita no demuestra que respalde correctamente la afirmación.
Validación fuerte.
10.6 Source ≠ Source Authority
Una fuente puede identificarse objetivamente.
Su autoridad necesita evaluación.
Validación fuerte.
10.7 Visibility ≠ Accuracy
Una entidad puede aparecer claramente y, sin embargo, estar representada incorrectamente.
Validación conceptual y empírica suficiente para mantener la distinción.
10.8 Cross-Model Coverage ≠ Presence
Presence es una observación por respuesta.
Coverage necesita múltiples engines.
Validación fuerte.
11. Hallazgo emergente: Entity Resolution
Este es probablemente el hallazgo más importante que no estaba suficientemente explicitado en OVF 0.1.
P01 demuestra que existe una diferencia entre:
String Recognition
El sistema reconoce la secuencia «AVM».
Entity Recognition
El sistema reconoce que existe una entidad asociada.
Entity Resolution
El sistema determina qué entidad concreta es.
Category Assignment
El sistema determina a qué categoría pertenece.
Attribution
El sistema determina quién la creó/desarrolló/representa.
El experimento demuestra que estos pasos pueden divergir.
Por tanto, P01 no es simplemente una prueba de Recognition.
Es una prueba de que:
la ambigüedad de entidad es una condición fundamental de la medición de AI Visibility.
La documentación experimental ya había llegado a esta observación al señalar explícitamente el fenómeno de desambiguación y la diferencia entre AVM™ como AI Visibility Model y otros significados de AVM.
12. Hallazgo estructural: observable ≠ evaluated ≠ derived
El experimento obliga a separar tres niveles.
Nivel 1 — Observable
Puede registrarse directamente.
Ejemplos:
Presence
Recognition
Category
Mention
Recommendation
Citation
Source
Nivel 2 — Evaluated
Necesita criterio externo.
Ejemplos:
Accuracy
Recommendation Quality
Source Authority
Source Fidelity
Nivel 3 — Derived
Necesita múltiples observaciones.
Ejemplos:
Frequency
Mention Rate
Coverage
SOV
Agreement
Consistency
Volatility
Esta separación constituye uno de los resultados metodológicos más importantes del experimento.
13. Contexto experimental
El experimento también demuestra que la respuesta no puede interpretarse independientemente de las condiciones bajo las cuales se obtuvo.
Las propias respuestas señalan:
diferencias entre plataformas;
estocasticidad;
variabilidad temporal;
diferencias de recuperación;
idioma;
ubicación;
sesión.
Gemini señala explícitamente que la misma consulta puede producir respuestas diferentes según sesión, ubicación, idioma o actualización del modelo.
Claude señala asimismo que la reproducibilidad requiere registrar:
prompt;
modelo;
versión;
fecha;
muestra;
plataforma;
repeticiones.
Por tanto:
Context y Experimental Metadata no son información secundaria. Son condiciones de interpretación de la observación.
14. Retrieval Mode como factor experimental
El experimento presenta además una dificultad importante:
no todas las respuestas se obtuvieron necesariamente bajo idénticas condiciones de recuperación.
En el corpus aparecen respuestas con:
web search;
fuentes;
URLs;
referencias;
respuestas sin recuperación equivalente.
Esto afecta especialmente a:
Citation;
Source;
Source Fidelity;
posiblemente Representation.
Conclusión
El modo de recuperación debe quedar registrado como condición experimental.
No se clasifica todavía como métrica de AI Visibility.
15. Limitaciones del experimento
15.1 Número de ejecuciones
Cada prompt no fue repetido sistemáticamente múltiples veces.
Por tanto, no podemos estimar:
distribución;
varianza;
volatilidad;
consistencia intra-modelo;
intervalos de confianza.
15.2 Perplexity incompleto
Perplexity dispone de P01–P11.
Por tanto:
las comparaciones Cross-Model P12–P20 no incluyen los cuatro sistemas.
15.3 Versionado de modelos
El dataset no proporciona en todos los casos un registro homogéneo y estructurado de:
modelo;
versión exacta;
fecha;
configuración.
Esto limita la reproducibilidad exacta.
15.4 Retrieval heterogéneo
Los sistemas no operan necesariamente bajo idéntico régimen de recuperación.
Esto impide interpretar Citation y Source como si fueran observaciones generadas bajo condiciones experimentales perfectamente equivalentes.
15.5 Corpus pequeño
20 prompts constituyen un buen experimento exploratorio, pero no un benchmark estadístico definitivo.
El objetivo del experimento era descubrir variables, no producir una estimación poblacional de AI Visibility.
15.6 Entity-specific experiment
El experimento está centrado en AVM™ y su ecosistema semántico.
Por tanto, no demuestra todavía que todas las variables se comporten idénticamente con:
marcas comerciales;
productos;
organizaciones;
personas;
conceptos;
entidades ambiguas;
entidades no ambiguas.
16. Qué NO puede concluir este experimento
Este documento no demuestra:
❌ cuál es el mejor modelo;
❌ cuál tiene mayor AI Visibility;
❌ cuál tiene mayor accuracy global;
❌ cuál tiene mayor Citation Rate;
❌ cuál tiene mayor Recommendation Rate;
❌ cuál tiene mayor consistencia;
❌ qué ponderación debe utilizar AVM™;
❌ cuál debe ser el AVM™ Score;
❌ qué dimensiones deben tener mayor peso;
❌ que AVM™ sea todavía un estándar universal;
❌ que las variables observadas sean definitivas.
Estas cuestiones quedan deliberadamente fuera del alcance.
17. Qué sí demuestra razonablemente el experimento
El experimento proporciona evidencia para afirmar que:
1. AI Visibility es multidimensional.
2. Presence no describe por sí sola la representación de una entidad.
3. Recognition y Entity Resolution pueden divergir.
4. Recognition y Attribution pueden divergir.
5. Mention y Recommendation son fenómenos diferentes.
6. Recommendation y Recommendation Quality requieren tratamientos epistemológicos diferentes.
7. Citation y Citation Validity son diferentes.
8. Source y Source Authority son diferentes.
9. Accuracy requiere un criterio externo.
10. Cross-Model Coverage es derivada.
11. Cross-Model Agreement no equivale a Intra-Model Consistency.
12. Volatility y Persistence requieren experimentación longitudinal.
13. La ambigüedad de entidad es una variable fundamental del problema.
14. El contexto de consulta y las condiciones de ejecución afectan la interpretación.
18. Registro de decisiones metodológicas
| Decisión | Motivo | Resultado |
| Mantener Raw Response | Trazabilidad | Confirmada |
| No calcular Score | Evitar ponderaciones prematuras | Confirmada |
| Separar Observable/Evaluated | Diferente naturaleza epistemológica | Confirmada |
| Separar Observable/Derived | Evitar confundir observación con agregación | Confirmada |
| No tratar Frequency como variable | Requiere agregación | Adoptada |
| No tratar Coverage como variable primaria | Requiere varios engines | Adoptada |
| No tratar Accuracy como observable puro | Requiere referencia | Adoptada |
| No tratar Source Authority como observable | Requiere evaluación | Adoptada |
| No validar Volatility | Falta repetición | Pendiente |
| No validar Persistence | Falta serie temporal | Pendiente |
| No validar Absorption | Falta inferencia causal | Pendiente |
| No validar Influence | Falta comportamiento de usuario | Pendiente |
| Registrar Retrieval Mode | Condición experimental relevante | Adoptada |
| Separar Cross-Model Agreement de Consistency | Fenómenos diferentes | Adoptada como hallazgo |
| Tratar Entity Resolution como fenómeno emergente | Evidencia P01–P04 | Registrada como hallazgo |
19. Registro de estado de las afirmaciones de OVF 0.1
Para evitar ambigüedad terminológica, se utilizan seis estados:
VALIDATED
La evidencia permite mantener la afirmación en su forma general.
PARTIALLY VALIDATED
El fenómeno existe, pero la formulación original necesita precisión.
DERIVED
No es una observación primaria; se calcula a partir de observaciones.
EVALUATED
Requiere referencia, criterio o juicio externo.
NOT VALIDATED
El experimento no permite comprobarlo.
FALSIFIED
La formulación original no resiste la evidencia observada.
20. Resultado consolidado
🟢 VALIDATED
Presence
Recognition
Category
Attribution
Recommendation
Citation
Source
Context
🟡 PARTIALLY VALIDATED
Mention
Position
Prominence
Recommendation Position
Methodology Recognition
Competitive Presence
Competitive Position
🔵 DERIVED
Frequency
Mention Rate
Recommendation Rate
Engine Coverage
Cross-Model Agreement
SOV
🟠 EVALUATED
Accuracy
Recommendation Quality
Attribution Accuracy
Source Authority
Source Fidelity
Citation Validity
⚪ NOT VALIDATED
Intra-Model Consistency
Volatility
Persistence
Absorption
Influence
🔴 FALSIFIED AS PRIMARY OBSERVABLE
Frequency como variable primaria
Engine Coverage como variable primaria
Position como ranking universal
Accuracy como observable directo
Source Authority como observable directo
21. Hallazgo principal del experimento
La evidencia acumulada permite reformular el problema de AI Visibility.
La pregunta inicial podía expresarse como:
¿Aparece una marca en una respuesta de IA?
El experimento demuestra que esta pregunta es insuficiente.
Una representación generativa puede requerir distinguir, como mínimo:
¿Qué entidad ha reconocido el sistema?
→ ¿La ha resuelto correctamente?
→ ¿La ha situado en la categoría correcta?
→ ¿La ha atribuido correctamente?
→ ¿La ha hecho presente?
→ ¿Cómo la representa?
→ ¿La recomienda?
→ ¿Con qué prominencia?
→ ¿Qué evidencia utiliza?
→ ¿Esta representación es correcta?
→ ¿Se comporta igual en otros sistemas?
Y, posteriormente:
→ ¿Se mantiene estable cuando repetimos el experimento?
22. Conclusión experimental
El experimento no confirma OVF 0.1 como taxonomía definitiva.
Eso no constituye un fracaso.
Es precisamente el resultado que se buscaba.
OVF 0.1 ha funcionado como una hipótesis de observación y el experimento ha permitido someter sus componentes a evidencia empírica.
El proceso ha producido tres tipos de resultados:
A. Variables que sobreviven
Algunas variables se muestran claramente observables y codificables.
B. Variables que deben cambiar de naturaleza
Algunas no son observaciones primarias sino:
evaluaciones;
métricas derivadas;
variables contextuales.
C. Fenómenos todavía no demostrados
Otros requieren nuevos diseños experimentales:
repetición;
longitudinalidad;
causalidad;
comportamiento del usuario.
El resultado más significativo es que el experimento revela una estructura más compleja que una simple métrica de presencia:
la visibilidad generativa implica no solamente aparición, sino resolución, reconocimiento, categorización, atribución, representación, recomendación y evidencia.
La evidencia P01–P20 demuestra además que estos fenómenos pueden divergir entre sistemas, incluso cuando reciben consultas equivalentes.
Por tanto, el experimento respalda provisionalmente la tesis fundamental que motivó OVF:
AI Visibility no debe reducirse a la frecuencia de menciones.
Pero también introduce una cautela esencial:
no todo fenómeno relacionado con AI Visibility puede tratarse como una variable observable primaria.
La arquitectura de medición debe distinguir rigurosamente entre:
observación → codificación → evaluación → métrica derivada → comportamiento Cross-Model → comportamiento temporal.
23. Estado del proyecto tras el experimento
El estado documental queda cerrado, deliberadamente, en:
OVF 0.1
│
▼
CROSS-MODEL EXPERIMENT
P01–P20
│
▼
VALIDATION AUDIT
│
├── VALIDATED
├── PARTIALLY VALIDATED
├── DERIVED
├── EVALUATED
├── NOT VALIDATED
└── FALSIFIED
Este documento no introduce OVF 0.2.
La revisión del framework constituye una fase posterior y deberá partir de este registro experimental, no modificar retrospectivamente sus resultados.
24. Registro de integridad del experimento
Para preservar la trazabilidad:
Dataset utilizado: respuestas originales P01–P20 disponibles para ChatGPT, Gemini y Claude; P01–P11 para Perplexity.
Número de respuestas: 71.
Corpus: 20 prompts oficiales.
Unidad primaria de análisis: respuesta individual de un sistema ante un prompt.
Unidad secundaria: comparación Cross-Model.
No se han realizado: ponderaciones, scoring, normalización de AVM Score ni selección definitiva de dimensiones.
Limitación principal: ausencia de repetición sistemática y cobertura incompleta de Perplexity.
Resultado: evidencia exploratoria suficiente para auditar y revisar OVF 0.1, pero insuficiente para establecer todavía un estándar cuantitativo definitivo.
Declaración final del documento
Este informe constituye el registro de la primera prueba empírica de AVM™ sobre su propio marco de variables observables.
Las variables no han sido consideradas válidas por haber sido propuestas previamente; han sido sometidas a evidencia.
Cuando la evidencia ha respaldado una afirmación, se registra como validada. Cuando ha obligado a modificar su interpretación, se registra como parcialmente validada. Cuando ha demostrado que una variable es derivada o evaluativa, se reclasifica. Cuando el experimento no permite comprobar una afirmación, se registra como no validada. Y cuando la formulación original no resiste la evidencia, se registra como falsada.
El siguiente desarrollo de AVM™ deberá construirse sobre este registro, no sobre las hipótesis originales.
Fuentes experimentales primarias
Los datos de este informe proceden de los documentos originales del experimento: 20 prompts oficiales ChatGPT, 20 prompts oficiales Gemini, 20 prompts oficiales Claude, 20 prompts oficiales Perplexity y el documento de desarrollo de OVF 0.1. Las respuestas y el marco metodológico permanecen como materiales primarios de referencia. Por ejemplo, el corpus de Claude conserva desde P01 la respuesta completa y la identificación de AI Visibility Model frente a otros significados de AVM. El corpus de Gemini documenta directamente la desambiguación de AVM, la posterior identificación de AI Visibility Model y las diferencias de comportamiento metodológico entre plataformas. El documento OVF 0.1 establece expresamente el examen de observabilidad, definición, codificación, reproducibilidad y comparabilidad utilizado en esta auditoría.
Documento cerrado en esta fase. No se adelanta OVF 0.2.
Manu Duque
AI Visibility Specialist
ai-visibility.es





