OVF 0.2 – Observable Variables Framework

 

Marco de Variables Observables

Revisión Empírica Basada en Evidencia Cross-Model

AVM™ — AI Visibility Model
Versión: 0.2
Estado: Marco revisado empíricamente
Base: Experimento Empírico Cross-Model P01–P20
Sistemas examinados: ChatGPT, Gemini, Claude, Perplexity
Ámbito: Arquitectura de variables observables para la medición de AI Visibility
Scoring: No definido en esta versión
Ponderaciones: No definidas en esta versión

 

1. Propósito

1.1 Objetivo

OVF 0.2 — Observable Variables Framework define las variables, clasificaciones, unidades de observación y requisitos de evidencia necesarios para medir AI Visibility como fenómeno empírico en diferentes sistemas de inteligencia artificial generativa.

OVF 0.2 constituye la revisión empírica de OVF 0.1, realizada después del experimento Cross-Model utilizando el mismo conjunto de prompts P01–P20 en diferentes sistemas de IA.

El objetivo principal es:

Establecer un vocabulario controlado y una arquitectura de medición para los fenómenos observables asociados con la visibilidad, representación y recomendación de entidades dentro de respuestas generadas por sistemas de IA.

OVF 0.2 NO intenta definir todavía un AI Visibility Score definitivo.

Establece la capa que debe preceder al scoring:

Qué puede observarse, qué puede evaluarse, qué puede derivarse, qué puede compararse y qué requiere evidencia longitudinal.

 

1.2 Principio fundamental

La AI Visibility NO DEBE operacionalizarse como una simple frecuencia de menciones.

El experimento empírico demostró que los siguientes fenómenos pueden divergir:

Recognition ≠ Entity Resolution
Entity Resolution ≠ Attribution
Mention ≠ Recommendation
Recommendation ≠ Recommendation Priority
Citation Presence ≠ Citation Validity
Source ≠ Source Fidelity
Visibility ≠ Accuracy

En consecuencia, OVF 0.2 trata la AI Visibility como un problema de medición multidimensional.

 

1.3 Lenguaje normativo

La siguiente terminología tiene carácter normativo:

DEBE

Indica un requisito obligatorio.

NO DEBE

Indica una práctica prohibida.

DEBERÍA

Indica una recomendación metodológica fuerte, de la que solo debería desviarse por razones metodológicas documentadas.

NO DEBERÍA

Indica una práctica que normalmente debe evitarse.

PUEDE

Indica una práctica opcional.

 

2. Alcance

OVF 0.2 se aplica a la medición empírica de cómo un sistema de IA representa una entidad objetivo determinada en respuesta a una consulta o prompt definido.

La entidad objetivo PUEDE ser:

una marca;

una empresa;

una persona;

un producto;

un servicio;

una metodología;

una organización;

un concepto;

un framework;

un dominio;

otra entidad explícitamente definida.

El framework está diseñado principalmente para sistemas de IA generativa capaces de producir respuestas en lenguaje natural.

Entre ellos:

IA conversacional;

sistemas de búsqueda generativa;

motores de respuestas basados en IA;

sistemas RAG;

interfaces de IA orientadas a la recomendación.

 

2.1 Fuera del alcance

OVF 0.2 no define:

  • un AVM™ Score;
  • un sistema universal de ponderaciones;
  • una fórmula definitiva de normalización;
  • impacto comercial;
  • conversión;
  • comportamiento del usuario;
  • influencia causal;
  • atribución de ingresos.

Estos aspectos PUEDEN convertirse en objetos de investigación posterior de AVM™, pero no quedan establecidos por OVF 0.2.

 

3. Relación con OVF 0.1

OVF 0.1 constituyó una hipótesis inicial sobre las variables que podrían ser necesarias para medir AI Visibility.

El experimento Cross-Model demostró que la arquitectura original, basada en una lista relativamente plana de variables, contenía variables con propiedades epistemológicas fundamentalmente diferentes.

Por ejemplo:

OVF 0.1 Problema descubierto
Presence Puede significar presencia de una cadena o presencia de la entidad objetivo
Recognition Contiene varios fenómenos de reconocimiento diferentes
Frequency Es una variable derivada de múltiples observaciones
Position Solo existe cuando existe una estructura de orden
Accuracy Requiere una referencia externa
Source Authority Requiere evaluación
Consistency Puede significar acuerdo Cross-Model o consistencia mediante ejecuciones repetidas
Coverage Requiere comparación entre sistemas
Volatility Requiere observaciones repetidas a lo largo del tiempo
Influence Requiere evidencia conductual/causal

Por tanto, OVF 0.2 no se limita a ampliar OVF 0.1.

Lo reestructura.

 

3.1 Principio de revisión

Una variable de OVF 0.1 NO DEBE conservarse en OVF 0.2 únicamente porque apareciera en la versión original.

Cada variable DEBE disponer de una base identificable en una o más de las siguientes categorías:

  1. observación empírica directa;
  2. necesidad operacional;
  3. medición derivada;
  4. análisis comparativo;
  5. análisis temporal.

 

4. Base empírica

OVF 0.2 se fundamenta principalmente en el Experimento Empírico Cross-Model AVM™ P01–P20.

El experimento utilizó un conjunto común de prompts en:

ChatGPT;

Gemini;

Claude;

Perplexity.

El dataset disponible contiene observaciones completas P01–P20 para ChatGPT, Gemini y Claude, y P01–P11 para Perplexity.

El corpus resultante contiene 71 respuestas de modelos documentadas.

El experimento fue exploratorio y no pretende ser estadísticamente representativo.

Su objetivo no era establecer estimaciones poblacionales.

Su objetivo era descubrir:

qué fenómenos pueden observarse realmente y distinguirse cuando diferentes sistemas de IA responden a consultas equivalentes.

 

4.1 Principales resultados empíricos

El experimento produjo evidencia que respalda las siguientes distinciones:

  1. Recognition ≠ Entity Resolution.
  2. Entity Resolution ≠ Attribution.
  3. Mention ≠ Recommendation.
  4. Recommendation ≠ Priority Recommendation.
  5. Citation Presence ≠ Citation Validity.
  6. Source ≠ Source Fidelity.
  7. Visibility ≠ Accuracy.
  8. La ambigüedad de entidad afecta materialmente a la medición de visibilidad.
  9. El comportamiento Cross-Model presenta diferencias entre sistemas.
  10. El contexto afecta a la visibilidad observada.
  11. Coverage se deriva de observaciones realizadas entre sistemas.
  12. Consistency requiere observaciones repetidas.
  13. Volatility requiere repetición temporal.
  14. Persistence requiere observación longitudinal.
  15. Accuracy requiere una referencia externa.
  16. Source Authority requiere evaluación y no una simple observación.

Estos hallazgos constituyen la base empírica de la arquitectura presentada a continuación.

 

5. Ontología de medición

OVF 0.2 establece seis clases principales de medición:

OVF 0.2

├── I. IDENTIFICACIÓN

├── II. REPRESENTACIÓN

├── III. RECOMENDACIÓN

├── IV. EVIDENCIA

├── V. DERIVADAS / COMPARATIVAS

└── VI. TEMPORALES

Se mantiene una séptima clase fuera del núcleo:

VII. DIFERIDAS / RESULTADOS

Esta distinción es intencionada.

 

5.1 Identificación

Las variables de identificación describen si el sistema ha reconocido y resuelto la entidad objetivo.

 

5.2 Representación

Las variables de representación describen cómo se representa la entidad una vez identificada.

 

5.3 Recomendación

Las variables de recomendación describen si el sistema recomienda la entidad y cómo lo hace.

 

5.4 Evidencia

Las variables de evidencia describen las citas y fuentes asociadas con las afirmaciones generadas.

 

5.5 Derivadas / Comparativas

Estas variables se calculan a partir de múltiples observaciones primarias o se generan comparando observaciones entre sistemas.

NO DEBEN confundirse con observaciones primarias.

 

5.6 Temporales

Las variables temporales requieren observaciones repetidas a lo largo del tiempo o ejecuciones repetidas.

Por tanto, no quedan completamente validadas por el experimento P01–P20.

 

6. Clasificación de variables

OVF 0.2 utiliza el siguiente sistema de clasificación:

Clase Código Descripción
Observable O Observable directamente en una respuesta
Identificación I Determinación observable de identidad/categoría
Representación R Representación observable de la entidad
Evaluación A Requiere un criterio o referencia externa
Derivada D Calculada a partir de observaciones primarias
Comparativa C Requiere comparación de múltiples observaciones
Temporal T Requiere ejecuciones repetidas a lo largo del tiempo
Diferida X No suficientemente validada para formar parte del núcleo

Una variable PUEDE presentar más de una característica, pero su estatus epistemológico primario DEBE declararse.

 

7. Variables de Entidad e Identificación

 

7.1 I-01 — Reconocimiento de Cadena

Definición

String Recognition / Reconocimiento de Cadena es la aparición observable en la que el sistema reconoce o reproduce el identificador textual asociado con la entidad objetivo.

Observación

El investigador registra si aparece la cadena relevante.

Ejemplo

Aparece:

AVM

Limitación fundamental

El Reconocimiento de Cadena NO DEBE interpretarse como evidencia de que se ha identificado correctamente la entidad.

Estado

Validada.

 

7.2 I-02 — Reconocimiento de Entidad

Definición

Entity Recognition / Reconocimiento de Entidad es la identificación observable de la entidad objetivo como una entidad diferenciada y no simplemente como una secuencia de caracteres.

Requisito

El sistema DEBE asociar la referencia con una entidad identificable.

Estado

Validada.

 

7.3 I-03 — Resolución de Entidad

Definición

Entity Resolution / Resolución de Entidad determina si el sistema asocia la referencia observada con la entidad objetivo correcta.

Ejemplo

La cadena:

AVM

puede referirse a:

AVM GmbH;

Automated Valuation Model;

Arteriovenous Malformation;

AI Visibility Model.

La resolución correcta depende de la entidad objetivo y del contexto de la consulta.

Regla

La aparición de la cadena objetivo NO DEBE codificarse automáticamente como una resolución correcta de entidad.

Estado

Variable emergente y validada empíricamente mediante P01–P04.

 

7.4 I-04 — Asignación de Categoría

Definición

Category Assignment / Asignación de Categoría registra la categoría o clase conceptual que el sistema asigna a la entidad objetivo.

Ejemplos

Una metodología puede clasificarse como:

metodología de IA;

metodología SEO;

framework de marketing;

modelo de medición.

Estado

Validada.

 

7.5 I-05 — Exactitud de Categoría

Definición

Category Accuracy / Exactitud de Categoría evalúa si la categoría asignada por el sistema corresponde a una clasificación de referencia previamente definida.

Clasificación

Evaluación.

Requisito

Debe establecerse una categoría de referencia antes de realizar la evaluación.

Estado

Variable de evaluación.

 

7.6 I-06 — Presencia de Atribución

Definición

Registra si el sistema atribuye explícitamente la entidad, metodología o concepto objetivo a una persona, organización o fuente identificada.

Estado

Validada.

 

7.7 I-07 — Exactitud de Atribución

Definición

Attribution Accuracy / Exactitud de Atribución evalúa si la atribución realizada por el sistema corresponde con la referencia establecida.

Clasificación

Evaluación.

Distinción fundamental

Attribution Presence ≠ Attribution Accuracy

Estado

Distinción respaldada empíricamente.

 

8. Variables de Representación

 

8.1 R-01 — Presencia de Entidad

Definición

Presencia explícita de la entidad objetivo en la respuesta generada.

Unidad

Una respuesta.

Estado

Validada.

 

8.2 R-02 — Mención de Entidad

Definición

Referencia explícita a la entidad objetivo dentro de la respuesta.

Una respuesta PUEDE contener:

cero menciones;

una mención;

múltiples menciones.

Regla

Cada mención DEBERÍA registrarse como una observación individual antes de realizar cualquier agregación.

Estado

Validada con refinamiento.

 

8.3 R-03 — Contexto de Mención

Definición

Contexto semántico en el que aparece una mención de la entidad.

Las categorías PUEDEN incluir:

respuesta directa;

recomendación;

comparación;

ejemplo;

contexto general;

cita;

mención incidental.

La taxonomía definitiva DEBERÍA definirse mediante el protocolo en función del objetivo de investigación.

Estado

Observable candidata.

 

8.4 R-04 — Representación

Definición

Descripción o caracterización sustantiva de la entidad objetivo generada por el sistema.

La representación puede incluir:

definición;

propósito;

función;

relación;

características;

metodología;

autoridad;

posicionamiento.

Estado

Fenómeno observable validado.

 

8.5 R-05 — Exactitud de Representación

Definición

Grado en que la representación generada corresponde con una representación de referencia establecida.

Clasificación

Evaluación.

Regla

La exactitud NO DEBE inferirse únicamente del hecho de que la entidad aparezca.

Estado

Dimensión de evaluación respaldada.

 

8.6 R-06 — Contexto de Respuesta

Definición

Rol contextual ocupado por la entidad dentro de la respuesta generada.

DEBERÍA distinguirse de Query Context / Contexto de Consulta.

Estado

Candidata; requiere pruebas operacionales adicionales.

 

9. Variables de Recomendación

 

9.1 REC-01 — Presencia de Recomendación

Definición

Registra si el sistema recomienda explícitamente la entidad objetivo en respuesta a la consulta.

Distinción

Una mención sin recomendación NO DEBE codificarse como recomendación.

Estado

Validada.

 

9.2 REC-02 — Tipo de Recomendación

Definición

Forma en la que se presenta la recomendación.

Puede incluir:

recomendación principal;

alternativa;

recomendación condicional;

opción secundaria;

recomendación comparativa.

La taxonomía exacta requiere investigación empírica adicional.

Estado

Candidata.

 

9.3 REC-03 — Prioridad de Recomendación

Definición

Prioridad relativa asignada por el sistema a la entidad cuando la respuesta expresa una jerarquía de recomendaciones.

Limitación importante

La prioridad NO DEBE inferirse únicamente de la posición textual.

Estado

Parcialmente validada.

 

9.4 REC-04 — Ranking de Recomendación

Definición

Posición ordinal explícita de la entidad objetivo dentro de una lista o ranking estructurado de recomendaciones.

Regla

Cuando no existe orden explícito:

Rank = No Aplicable

La ausencia de un ranking ordinal NO DEBE convertirse en cero numérico.

Estado

Parcialmente validada.

 

9.5 REC-05 — Prominencia de Recomendación

Definición

Saliencia relativa de la recomendación dentro de la respuesta.

La prominencia DEBE codificarse mediante reglas previamente definidas y no mediante una interpretación subjetiva libre.

Estado

Parcialmente validada.

 

9.6 REC-06 — Calidad de Recomendación

Definición

Evaluación de la adecuación y calidad de una recomendación conforme a criterios previamente definidos.

Clasificación

Evaluación.

Requisito

Los criterios de evaluación DEBEN definirse independientemente de la respuesta evaluada.

Estado

Variable de evaluación.

 

10. Variables de Evidencia

 

10.1 E-01 — Presencia de Cita

Definición

Registra si la respuesta generada contiene una cita o referencia explícita identificable asociada a una afirmación.

Estado

Validada.

 

10.2 E-02 — Destino de la Cita

Definición

Identifica la fuente o documento al que se refiere una cita.

Estado

Observable.

 

10.3 E-03 — Contexto de la Cita

Definición

Registra la afirmación o proposición que la cita pretende respaldar.

Estado

Observable mediante reglas de codificación.

 

10.4 E-04 — Validez de la Cita

Definición

Grado en que la fuente citada respalda realmente la afirmación para la cual se presenta como evidencia.

Clasificación

Evaluación.

Distinción fundamental

Citation Presence ≠ Citation Validity

Estado

Distinción respaldada empíricamente.

 

10.5 E-05 — Identidad de la Fuente

Definición

Fuente identificable utilizada, referenciada o presentada por el sistema de IA.

Estado

Observable.

 

10.6 E-06 — Fidelidad de la Fuente

Definición

Grado en que la representación generada conserva correctamente el significado relevante de la fuente citada.

Clasificación

Evaluación.

Distinción fundamental

Source Identity ≠ Source Fidelity

Estado

Variable de evaluación.

 

10.7 E-07 — Autoridad de la Fuente

Definición

Autoridad o fiabilidad evaluada de una fuente conforme a criterios previamente establecidos.

Estos criterios PUEDEN incluir:

procedencia;

especialización;

independencia;

verificabilidad;

actualidad;

autoridad institucional.

Clasificación

Evaluación.

Estado

No es una observación primaria.

 

11. Variables Derivadas

Las variables derivadas DEBEN calcularse a partir de observaciones primarias registradas.

NO DEBEN sustituir a las observaciones subyacentes.

 

11.1 D-01 — Frecuencia de Mención

Definición

Número de eventos de Mención de Entidad observados dentro de una respuesta o dataset definido.

Fórmula

OVF 0.2 no establece todavía una fórmula universal.

Requisito

El denominador y la unidad de observación DEBEN declararse.

Estado

Derivada.

 

11.2 D-02 — Tasa de Mención

Definición

Proporción de observaciones definidas en las que se menciona la entidad objetivo.

Estado

Derivada.

 

11.3 D-03 — Tasa de Recomendación

Definición

Proporción de observaciones aplicables en las que se observa Presencia de Recomendación.

Estado

Derivada.

 

11.4 D-04 — Tasa de Citas

Definición

Proporción de observaciones aplicables que contienen Presencia de Cita.

Estado

Derivada.

 

11.5 D-05 — Cobertura Cross-Model

Definición

Extensión en la que la entidad objetivo es observada entre los sistemas de IA incluidos en un protocolo de medición definido.

Requisito

Debe declararse el conjunto de sistemas evaluados.

Estado

Derivada / Comparativa.

 

11.6 D-06 — Share of Voice

Share of Voice PUEDE calcularse a partir de menciones o recomendaciones a nivel de entidad respecto a un conjunto competitivo definido.

Sin embargo:

SOV no es una variable observable.

Es una métrica derivada.

Estado

Derivada.

 

12. Variables Comparativas

Las variables comparativas requieren múltiples observaciones.

 

12.1 C-01 — Acuerdo Cross-Model

Definición

Grado en que diferentes sistemas de IA producen observaciones equivalentes o suficientemente similares bajo una misma condición experimental definida.

Distinción importante

El Acuerdo Cross-Model no implica que ninguno de los sistemas sea correcto.

Estado

Derivada / Comparativa.

 

12.2 C-02 — Divergencia Cross-Model

Definición

Grado en que los sistemas difieren en su comportamiento de identificación, representación, recomendación o utilización de evidencia bajo condiciones equivalentes.

Estado

Derivada / Comparativa.

 

12.3 C-03 — Cobertura Cross-Model

La Cobertura Cross-Model registra si el fenómeno objetivo se observa en los sistemas incluidos en el experimento.

DEBE distinguirse de:

Intra-Model Consistency / Consistencia Intra-Modelo.

Estado

Comparativa / Derivada.

 

13. Variables Temporales

Las variables temporales se separan explícitamente porque no fueron suficientemente validadas mediante P01–P20.

 

13.1 T-01 — Consistencia Intra-Modelo

Definición

Grado en que un mismo sistema de IA produce observaciones materialmente consistentes bajo ejecuciones repetidas de una misma condición definida.

Requisito

Se requieren al menos dos ejecuciones.

Para obtener una estimación robusta DEBERÍA utilizarse un número considerablemente mayor de repeticiones.

Estado

No validada por el experimento actual.

 

13.2 T-02 — Volatilidad

Definición

Grado de variación de un fenómeno de AI Visibility observado a través de ejecuciones repetidas o intervalos temporales definidos.

Estado

No validada.

 

13.3 T-03 — Persistencia

Definición

Grado en que un fenómeno de visibilidad observado permanece presente a través de diferentes observaciones temporales.

Estado

No validada.

 

13.4 T-04 — Deriva Temporal

Definición

Cambio en la representación, recomendación o evidencia asociada con una entidad a lo largo del tiempo.

Estado

Variable de investigación.

 

14. Variables Diferidas / No Validadas

OVF 0.2 registra explícitamente variables que NO DEBEN tratarse todavía como variables núcleo validadas.

 

14.1 Absorción

El experimento puede observar:

fuente citada.

Pero no puede demostrar causalmente:

la fuente causó la representación del modelo.

Por tanto, Absorción queda diferida.

 

14.2 Influencia

Influence / Influencia requiere evidencia sobre comportamiento fuera de la respuesta generada.

Por ejemplo:

decisión del usuario;

clic;

selección;

conversión;

cambio de comportamiento.

Nada de ello fue medido en P01–P20.

Por tanto:

Influence queda fuera del núcleo validado de OVF 0.2.

 

14.3 Resultado empresarial

Ingresos, conversión, generación de leads y resultados comerciales no son observables de AI Visibility.

PUEDEN relacionarse posteriormente con investigaciones de AI Visibility, pero NO DEBEN incorporarse al núcleo de OVF sin evidencia empírica adicional.

 

15. Unidades de Observación

Un protocolo de medición reproducible DEBE definir su unidad de observación.

OVF 0.2 reconoce las siguientes:

15.1 Prompt

Consulta definida presentada al sistema de IA.

 

15.2 Ejecución

Una ejecución efectiva de un prompt contra un sistema bajo condiciones especificadas.

 

15.3 Respuesta

Output generado como resultado de una ejecución.

 

15.4 Mención de Entidad

Una aparición explícita de la entidad objetivo.

 

15.5 Afirmación

Proposición o afirmación factual realizada dentro de una respuesta.

 

15.6 Cita

Referencia identificable asociada con una afirmación.

 

15.7 Fuente

Objeto de información externo asociado con una cita o atribución.

 

15.8 Dataset

Colección definida de ejecuciones que comparten determinadas condiciones experimentales.

 

16. Principios de Codificación

 

16.1 La evidencia original DEBE conservarse

La respuesta completa generada DEBERÍA conservarse.

Los investigadores NO DEBEN depender exclusivamente de resúmenes extraídos manualmente.

 

16.2 Observación e interpretación DEBEN separarse

El investigador DEBERÍA registrar primero:

Observación

«AVM aparece en la respuesta.»

y después:

Interpretación

«El sistema reconoció AVM™.»

Esta distinción es esencial.

 

16.3 La ausencia DEBE distinguirse de la no aplicabilidad

Los siguientes estados NO DEBEN confundirse:

Presente;

Ausente;

No Aplicable;

No Observable;

Desconocido;

No Evaluado.

 

16.4 La ausencia de evidencia NO DEBE codificarse como evidencia negativa

Si no existe ranking:

Rank = N/A

no:

Rank = 0.

Si no existe fuente:

Source = None Observed

no:

Source Authority = 0.

 

16.5 La evaluación externa DEBE documentarse

Cuando se utilice una variable de evaluación, DEBEN documentarse la referencia y los criterios utilizados.

 

16.6 Las reglas de codificación DEBERÍAN versionarse

Cualquier modificación de una regla de codificación DEBERÍA generar una nueva versión del protocolo.

Los datasets históricos NO DEBERÍAN recodificarse silenciosamente utilizando nuevas reglas.

 

16.7 La redacción exacta del prompt DEBE conservarse

El prompt exacto utilizado para una observación DEBE conservarse.

Una paráfrasis posterior del prompt NO DEBE sustituir al original.

 

17. Requisitos de Evidencia

Una medición OVF válida DEBERÍA conservar metadatos suficientes para reproducir o auditar la observación.

Como mínimo:

Campo Requisito
ID del Prompt DEBE
Prompt exacto DEBE
Entidad objetivo DEBE
Sistema de IA DEBE
Modelo/versión DEBERÍA
Fecha/hora de ejecución DEBE
Idioma DEBERÍA
Modo web/retrieval DEBERÍA
Respuesta original DEBE
Codificación de observaciones DEBE
Versión del protocolo de codificación DEBE
Referencia externa DEBE para variables de evaluación
Investigador/anotador DEBERÍA
ID de ejecución DEBERÍA

 

 

17.1 Jerarquía de evidencia

OVF 0.2 recomienda la siguiente jerarquía:

Nivel 1 — Respuesta original

Evidencia primaria.

Nivel 2 — Observación estructurada

Información codificada extraída de la respuesta original.

Nivel 3 — Referencia externa

Necesaria para evaluaciones de exactitud y validez.

Nivel 4 — Métrica derivada

Calculada a partir de observaciones estructuradas.

Nivel 5 — Resultado comparativo

Producido a partir de múltiples observaciones.

Nivel 6 — Resultado temporal

Producido a partir de observaciones repetidas a lo largo del tiempo.

Esta jerarquía DEBE mantenerse al presentar resultados.

 

18. Plantilla de Especificación de Variable

Toda variable OVF DEBERÍA especificarse utilizando un esquema común:

ID de Variable

Nombre

Clase

Estado

Definición

Propósito

Unidad de Observación

Evidencia Observable

Regla de Codificación

Valores Permitidos

Condición de No Aplicabilidad

Requiere Referencia Externa

Primaria / Derivada

Comparativa

Temporal

Base de Validación

Limitaciones Conocidas

Versión

 

18.1 Ejemplo

OVF-I03

Variable: Entity Resolution / Resolución de Entidad

Clase: Identificación

Estado: Validada / emergente

Definición:
Determinación de si el sistema asocia una referencia observada con la entidad objetivo correcta.

Unidad de Observación:
Respuesta / mención de entidad.

Evidencia Observable:
Interpretación de entidad establecida explícita o implícitamente por la respuesta.

Referencia Externa:
Sí, para establecer cuál es la entidad objetivo.

Primaria / Derivada:
Primaria.

Comparativa:
Opcional.

Temporal:
Opcional.

Base de Validación:
P01–P04.

 

19. Estado de Validación

OVF 0.2 utiliza las siguientes categorías de estado.

 

V1 — Empíricamente Validada

El fenómeno fue observado directamente con suficiente evidencia para justificar su inclusión como variable primaria.

Ejemplos:

Entity Presence;

Entity Recognition;

Entity Resolution;

Recommendation Presence;

Citation Presence;

Source Identity.

 

V2 — Parcialmente Validada

El fenómeno existe, pero requiere una mayor especificación operacional.

Ejemplos:

Recommendation Prominence;

Recommendation Priority;

Recommendation Rank;

Mention Context.

 

V3 — Evaluada

La variable requiere una referencia externa o criterios previamente definidos.

Ejemplos:

Representation Accuracy;

Category Accuracy;

Attribution Accuracy;

Citation Validity;

Source Fidelity;

Source Authority;

Recommendation Quality.

 

V4 — Derivada

La variable se calcula a partir de otras observaciones.

Ejemplos:

Mention Frequency;

Mention Rate;

Citation Rate;

Cross-Model Coverage;

Share of Voice.

 

V5 — Comparativa

La variable requiere observaciones procedentes de múltiples sistemas.

Ejemplos:

Cross-Model Agreement;

Cross-Model Divergence.

 

V6 — Temporal / No Validada

El fenómeno requiere evidencia repetida o longitudinal.

Ejemplos:

Intra-Model Consistency;

Volatility;

Persistence;

Temporal Drift.

 

V7 — Diferida

El fenómeno no ha demostrado todavía suficiente observabilidad para formar parte del núcleo validado.

Ejemplos:

Absorption;

Influence.

 

20. Preguntas de Investigación Abiertas

OVF 0.2 deja deliberadamente varias cuestiones sin resolver.

Estas preguntas no constituyen defectos del framework.

Definen la agenda de investigación empírica posterior.

 

20.1 ¿Cómo debe medirse Entity Resolution?

El framework establece el fenómeno.

Todavía no establece si la resolución debe ser:

binaria;

categórica;

probabilística;

basada en confianza.

 

20.2 ¿Cómo debe establecerse Representation Accuracy?

Será necesario determinar:

fuente de referencia;

ground truth;

unidades factuales;

equivalencia semántica;

corrección parcial;

contradicción.

 

20.3 ¿Cómo debe codificarse Prominence?

Es necesario establecer una distinción reproducible entre:

principal;

secundaria;

incidental;

comparativa;

contextual.

 

20.4 ¿Puede separarse de forma fiable Recommendation Priority de Position?

Un modelo puede colocar una entidad en primer lugar sin afirmar explícitamente que es la preferida.

Por tanto:

Rank ≠ Priority

debe ser sometido a una prueba experimental específica.

 

20.5 ¿Cómo debe medirse Citation Validity?

La investigación futura deberá establecer si la validez debe medirse:

de forma binaria;

parcialmente;

a nivel de afirmación;

a nivel de fuente.

 

20.6 ¿Cómo debe medirse Source Fidelity?

Se necesita un protocolo que permita comparar:

significado de la fuente

con

representación generada.

 

20.7 ¿Cuántas ejecuciones repetidas son necesarias?

Esta cuestión es esencial para:

consistencia;

volatilidad;

intervalos de confianza;

significación estadística.

 

20.8 ¿Cómo debe definirse Cross-Model Agreement?

El acuerdo puede referirse a:

reconocimiento de entidad;

categoría;

recomendación;

ranking;

fuente;

representación.

Por tanto, un único indicador universal de acuerdo podría resultar inadecuado.

 

20.9 ¿Cómo debe controlarse el contexto de consulta?

La misma entidad puede presentar una visibilidad diferente dependiendo de si la consulta es:

genérica;

navegacional;

comparativa;

transaccional;

informativa;

orientada a recomendación.

 

20.10 ¿La ambigüedad de entidad distorsiona sistemáticamente la AI Visibility?

La evidencia de P01 sugiere que puede hacerlo.

Esto requiere un experimento específico utilizando:

entidades ambiguas;

entidades no ambiguas;

entidades conocidas;

entidades desconocidas.

 

20.11 ¿El modo de recuperación modifica la Visibility independientemente del comportamiento del modelo?

Será necesario realizar experimentos controlados con:

web activada;

web desactivada;

conjuntos de fuentes controlados;

entornos de retrieval controlados.

 

20.12 ¿Puede AI Visibility conectarse finalmente con resultados del usuario?

Esta cuestión queda fuera de OVF 0.2.

Solo debería abordarse cuando la capa observacional esté suficientemente estabilizada.

 

21. Control de Versiones

 

21.1 Versión

OVF 0.2

Estado

Revisión Empírica

Predecesor

OVF 0.1

Base de revisión

Experimento Empírico Cross-Model AVM™ P01–P20

 

21.2 Naturaleza de la revisión

OVF 0.2 representa una revisión estructural y no una simple ampliación de variables.

El cambio principal consiste en introducir una separación explícita entre:

Observación Primaria → Evaluación → Medición Derivada → Análisis Comparativo → Análisis Temporal

 

21.3 Principales cambios respecto a OVF 0.1

 

Añadidas

String Recognition;

Entity Recognition;

Entity Resolution;

Category Assignment;

Attribution Presence;

Citation Target;

Citation Context;

Source Identity;

Cross-Model Divergence;

estatus formal de evidencia.

 

Divididas

Recognition;

Category;

Attribution;

Citation;

Source;

Consistency.

 

Reclasificadas

Frequency → Derivada;

Coverage → Derivada/Comparativa;

Accuracy → Evaluación;

Source Authority → Evaluación;

Recommendation Quality → Evaluación.

 

Diferidas

Volatility;

Persistence;

Intra-Model Consistency;

Absorption;

Influence.

 

21.4 No objetivos de la versión 0.2

OVF 0.2 NO ESTABLECE:

AVM™ Score;

ponderaciones de métricas;

normalización;

umbrales universales de benchmark;

niveles de madurez;

scoring comercial;

atribución económica.

Estas decisiones NO DEBEN introducirse simplemente para completar el framework.

 

21.5 Principio para futuras revisiones

Toda versión futura de OVF DEBERÍA documentar:

  1. la evidencia empírica que sustenta el cambio;
  2. la variable afectada;
  3. la razón del cambio;
  4. si el cambio es aditivo o estructural;
  5. su compatibilidad con versiones anteriores;
  6. su efecto sobre datasets previamente recopilados.

 

Declaración final

OVF 0.2 establece una arquitectura de medición, no un score.

La principal lección obtenida del experimento Cross-Model P01–P20 es que AI Visibility no puede tratarse como un único fenómeno observable.

Un sistema puede:

reconocer una cadena sin resolver la entidad objetivo;

resolver una entidad sin atribuirla correctamente;

mencionar una entidad sin recomendarla;

recomendar una entidad sin priorizarla;

citar una fuente sin que la cita sea válida;

utilizar una fuente sin representarla fielmente;

hacer que una entidad tenga una elevada visibilidad mientras la representa incorrectamente.

 

Por ello, OVF 0.2 establece una jerarquía:

IDENTIFICACIÓN → REPRESENTACIÓN → RECOMENDACIÓN → EVIDENCIA

y separa estas observaciones primarias de:

EVALUACIÓN → DERIVACIÓN → COMPARACIÓN → ANÁLISIS TEMPORAL

 

Esta separación constituye el cambio metodológico central respecto a OVF 0.1.

Por tanto, el framework adopta el siguiente principio:

Ninguna métrica derivada DEBE tratarse como una observación primaria. Ninguna evaluación DEBE presentarse como una observación. Ningún resultado comparativo DEBE interpretarse como una observación individual. Ninguna propiedad temporal DEBE inferirse a partir de una única ejecución.

El experimento Cross-Model no establece todavía el sistema definitivo de medición de AVM™.

Establece algo más fundamental:

la arquitectura empírica desde la que puede construirse posteriormente dicho sistema.

Y, de forma especialmente importante, OVF 0.2 todavía no determina cuánto debe pesar cada variable.

Esa cuestión pertenece a una fase posterior.

La siguiente capa lógica después de OVF 0.2, por tanto, no debería ser directamente AVM™ Score.

Debe ser:

AVM™ Metrics Framework — Framework de Métricas AVM™

que defina cómo cada observable validado se transforma en una medición reproducible.

Solo después de que esa capa haya sido sometida a pruebas debería plantearse el scoring, la normalización y las ponderaciones.

 

Conclusión metodológica

OVF 0.2 — Observable Variables Framework cierra la transición desde una lista inicial de variables basada en hipótesis hacia una ontología de medición de AI Visibility derivada de evidencia experimental Cross-Model.

El recorrido queda así:

OVF 0.1

Hipótesis inicial

Experimento P01–P20

Evidencia empírica

Architecture Review

Auditoría crítica

OVF 0.2

Arquitectura de variables

AVM™ Metrics Framework

Transformación de observables

AVM™ Score

Scoring / normalización / ponderación

 

La metodología, por tanto, no comienza con un número.

Comienza con una pregunta mucho más básica:

¿Qué podemos observar, demostrar y reproducir?

Y esa es precisamente la función de OVF 0.2.

 

 

Manu Duque
AI Visibility Specialist
ai-visibility.es

 

PCI™ – L01 Longitudinal Metrics Report 0.1

  AI Visibility Longitudinal Measurement and Prediction Opportunity Assessment Proyecto: AVM™ + PCI™ Estudio: PCI™-L01 Versión: 0.1 Estado: Exploratorio Entidad: E01 — Otterly Ondas analizadas: T0, T1, T2, T3 Modelos: M01–M04 Prompts: P01–P05 Observaciones RAW: 80 Unidad de análisis: Entity × Model × Prompt ×

Leer más »
Manu Duque
Resumen de privacidad

Esta web utiliza cookies para que podamos ofrecerte la mejor experiencia de usuario posible. La información de las cookies se almacena en tu navegador y realiza funciones tales como reconocerte cuando vuelves a nuestra web o ayudar a nuestro equipo a comprender qué secciones de la web encuentras más interesantes y útiles.

Nunca almacenamos información personal.

Puedes revisar nuestra política en la página de Política de Privacidad, Condiciones de Uso y Cookies.