AVM™ Metrics Framework 0.1

 

Especificación de Medición Reproducible

Estado: Especificación experimental
Versión: 0.1
Arquitectura de referencia: AVM™ Metrics Architecture Review 0.1
Modelo de entrada: OVF 0.2 — Observable Variables Framework
Ámbito: Medición de la Visibilidad IA en sistemas de inteligencia artificial
Exclusiones: AVM™ Score, ponderaciones, scoring compuesto y scoring de madurez

 

1. Propósito

AVM™ Metrics Framework 0.1 define la primera especificación operativa para transformar las variables observables identificadas en OVF 0.2 en mediciones que puedan ser reproducidas, inspeccionadas y auditadas de forma independiente.

El propósito de este documento no es establecer un sistema definitivo de puntuación.

Su propósito es más fundamental y específico:

Especificar cómo debe identificarse, codificarse, evaluarse y registrarse un fenómeno observable antes de que pueda convertirse en una métrica.

El framework establece, por tanto, una capa metodológica intermedia entre:

Variable Observable

y

Métrica

La secuencia fundamental es:

Observación → Evidencia → Codificación → Evaluación → Medición

Solo después de validar esta secuencia deberían utilizarse las mediciones para realizar cálculos comparativos o compuestos.

 

2. Relación con OVF 0.2

OVF 0.2 estableció qué puede observarse en una respuesta de IA.

Metrics Framework 0.1 establece cómo pueden medirse esas observaciones.

La distinción es intencionada.

OVF pregunta:

¿Qué fenómeno está presente en la respuesta?

Metrics Framework pregunta:

¿Qué evidencia demuestra ese fenómeno, cómo se codifica y bajo qué condiciones puede reproducirse la medición?

Por tanto:

OVF 0.2

Variables Observables

Metrics Framework 0.1

Medición Operativa

Métricas Validadas

La presencia de una variable en OVF 0.2 no implica automáticamente que se convierta en una métrica.

Primero debe demostrar suficiente:

observabilidad;

codificabilidad;

reproducibilidad;

auditabilidad.

 

3. Principio de elegibilidad para la medición

Una variable solo debería convertirse en métrica cuando pueda demostrarse la siguiente cadena:

Observable → Codificable → Reproducible → Auditable → Métrica

Si alguna de estas condiciones no puede demostrarse en el estado actual del conocimiento, la variable podrá permanecer como:

variable auxiliar;

variable de evaluación;

variable de investigación;

variable aplazada;

o variable descartada.

 

Esto evita que el framework convierta distinciones conceptuales en valores numéricos sin suficiente respaldo metodológico.

 

4. Arquitectura de medición

AVM™ Metrics Framework 0.1 separa la medición en cinco capas.

CAPA 1

OBSERVACIÓN

¿Qué produce el sistema de IA?

 

 

CAPA 2

CODIFICACIÓN

¿Qué fenómeno observable está presente?

 

 

CAPA 3

EVALUACIÓN

¿La observación satisface un criterio externo?

 

 

CAPA 4

DERIVACIÓN

¿Una o varias observaciones codificadas pueden

producir una medición reproducible?

 

 

CAPA 5

COMPARACIÓN

¿Pueden compararse las mediciones entre

respuestas, consultas o sistemas de IA?

El framework no presupone que todas las variables deban pasar por las cinco capas.

Por ejemplo, Autoridad de la Fuente puede requerir una evaluación externa, mientras que Presencia de Entidad puede establecerse principalmente mediante observación directa.

 

5. Registro de medición

Toda observación utilizada para generar una medición AVM™ DEBERÍA conservar un registro mínimo de evidencia.

El registro DEBERÍA contener:

sistema de IA;

modelo/versión, cuando esté disponible;

consulta/prompt;

respuesta;

fecha y hora;

entidad objetivo;

segmento relevante de la respuesta;

variable codificada;

valor codificado;

ubicación de la evidencia;

identidad del evaluador o ID anonimizado;

estado de incertidumbre;

estado de adjudicación, cuando corresponda.

 

El objetivo es garantizar la trazabilidad.

Una métrica sin una observación recuperable no puede considerarse completamente auditable.

 

6. Formato de especificación de variables

Cada variable de este framework se especifica mediante la siguiente estructura:

ID de variable

Nombre

Definición operacional

Fenómeno representado

Evidencia requerida

Unidad de observación

Unidad de análisis

Método de codificación

Valores permitidos

Reglas de inclusión

Reglas de exclusión

Tratamiento de N/A

Tratamiento de la incertidumbre

Requisito de evaluación externa

Requisito de ground truth

Criterio de validación

Riesgos de medición

Prueba de reproducibilidad

Limitaciones

Estado

 

7. Variables centrales de observación

 

7.1 Identificación de entidad / marca

ID de variable

OV-ENT-01

Nombre

Identificación de Entidad

Definición operacional

Determina si la entidad objetivo puede identificarse inequívocamente en la respuesta generada por la IA.

La identificación requiere evidencia suficiente de que la respuesta se refiere a la entidad objetivo y no a otra entidad homónima, genérica o semánticamente relacionada.

Fenómeno representado

El reconocimiento explícito de la entidad objetivo por parte del sistema de IA.

Evidencia requerida

El segmento exacto de la respuesta en el que se identifica la entidad.

Unidad de observación

Una respuesta generada por IA.

Unidad de análisis

Entidad objetivo dentro de una respuesta.

Método de codificación

El evaluador determina si la respuesta contiene una referencia identificable a la entidad objetivo.

Valores permitidos

1 — Identificada

0 — No identificada

N/A — No puede determinarse

 

Reglas de inclusión

La identificación DEBERÍA codificarse cuando:

la entidad se menciona explícitamente;

se utiliza un equivalente inequívoco;

el contexto establece claramente la entidad objetivo.

 

Reglas de exclusión

La identificación NO DEBERÍA codificarse cuando:

la respuesta se refiere únicamente a la industria;

la respuesta describe una categoría genérica;

la entidad no puede distinguirse de otra;

la referencia es especulativa y no puede atribuirse con suficiente confianza.

 

N/A

N/A DEBERÍA utilizarse únicamente cuando la evidencia sea insuficiente para determinar si la referencia corresponde a la entidad objetivo.

Incertidumbre

Las identificaciones ambiguas DEBERÍAN marcarse en lugar de convertirse silenciosamente en identificaciones positivas.

Evaluación externa requerida

No, salvo que exista una disputa sobre la desambiguación de la entidad.

Ground truth

La definición de entidad objetivo establecida antes de la medición.

Criterio de validación

Los anotadores independientes DEBERÍAN alcanzar un nivel sustancial de acuerdo en la clasificación.

Riesgos de medición

ambigüedad de entidades;

alias;

variaciones ortográficas;

homónimos;

referencias indirectas;

interpretación contextual.

Prueba de reproducibilidad

Dos anotadores independientes clasifican la misma respuesta sin consultar las decisiones del otro.

Limitaciones

La identificación de una entidad no establece recomendación, calidad, exactitud ni prominencia.

Estado

Variable central de observación.

 

7.2 Mención de entidad

ID de variable

OV-ENT-02

Nombre

Mención de Entidad

Definición operacional

Presencia de una referencia textual explícita a la entidad objetivo dentro de la respuesta.

Fenómeno representado

Representación superficial de la entidad.

Evidencia requerida

La aparición textual exacta o un equivalente claramente identificable.

Unidad de observación

Respuesta.

Unidad de análisis

Ocurrencia de la entidad.

Método de codificación

Cada ocurrencia que cumpla los criterios podrá registrarse según las reglas establecidas en el protocolo de anotación.

Valores permitidos

En Framework 0.1:

Presente

Ausente

N/A

 

El número bruto de menciones PUEDE conservarse como dato observacional, pero todavía no se designa como componente definitivo de una puntuación.

Reglas de inclusión

Una mención cualifica cuando se refiere a la entidad objetivo.

Reglas de exclusión

No deben contabilizarse:

homónimos no relacionados;

términos genéricos de categoría;

referencias que no puedan vincularse a la entidad objetivo.

N/A

Solo cuando no pueda resolverse la identidad de la entidad.

Incertidumbre

Las referencias ambiguas DEBERÍAN marcarse para adjudicación.

Evaluación externa requerida

No.

Ground truth

Identidad de la entidad objetivo.

Criterio de validación

Los anotadores independientes deberían clasificar de forma consistente las menciones que cumplen los criterios.

Riesgos de medición

menciones repetidas;

pronombres;

alias;

abreviaturas;

desambiguación de entidades.

 

Prueba de reproducibilidad

Anotación independiente de respuestas idénticas.

Limitaciones

La mención no implica recomendación ni visibilidad positiva.

Estado

Variable central de observación.

 

8. Variables de representación

 

8.1 Representación

ID de variable

OV-REP-01

Nombre

Representación de Entidad

Definición operacional

Determina si la entidad objetivo está representada de forma sustantiva y no simplemente como una referencia textual aislada.

Fenómeno representado

El grado en que el sistema de IA incorpora la entidad al contenido semántico de la respuesta.

Evidencia requerida

Fragmento relevante de la respuesta que muestre el papel de la entidad.

Unidad de observación

Respuesta.

Unidad de análisis

Relación entidad-respuesta.

Método de codificación

El evaluador determina si la entidad está representada sustantivamente de acuerdo con reglas de anotación previamente definidas.

Valores permitidos

Sustantiva

Incidental

Ausente

N/A

 

Reglas de inclusión

La representación requiere algo más que una simple aparición textual.

Reglas de exclusión

Una mención aislada NO DEBERÍA considerarse automáticamente representación sustantiva.

N/A

Cuando la evidencia no permita distinguir entre representación incidental y sustantiva.

Incertidumbre

Los casos límite DEBEN marcarse.

Evaluación externa requerida

Potencialmente, dependiendo del protocolo definitivo de anotación.

Ground truth

No necesariamente requerido en la fase inicial de observación.

Criterio de validación

Acuerdo entre anotadores.

Riesgos de medición

interpretación subjetiva;

longitud de la respuesta;

dependencia contextual;

sesgo del evaluador.

 

Prueba de reproducibilidad

Codificación independiente utilizando instrucciones y evidencia idénticas.

Limitaciones

La representación sigue siendo conceptualmente distinta de la recomendación.

Estado

Variable central de observación; requiere validación operacional.

 

9. Variables de recomendación

 

9.1 Recomendación

ID de variable

OV-REC-01

Nombre

Recomendación

Definición operacional

Una respuesta contiene una recomendación cuando el sistema de IA presenta explícita o funcionalmente la entidad objetivo como una opción que el usuario debería considerar, seleccionar, utilizar, comprar, visitar, adoptar o preferir en relación con la intención planteada.

Fenómeno representado

Selección preferencial mediada por IA.

Evidencia requerida

El fragmento de la respuesta que establece la recomendación.

Unidad de observación

Respuesta.

Unidad de análisis

Entidad objetivo en relación con la intención del usuario.

Método de codificación

La recomendación DEBE determinarse a partir de:

la referencia a la entidad; y

la relación semántica entre la entidad y la consulta del usuario.

Valores permitidos

Recomendada

No recomendada

Ambigua

N/A

 

Reglas de inclusión

Una recomendación puede ser explícita o funcionalmente equivalente.

Ejemplos:

recomendación directa;

clasificación dentro de alternativas recomendadas;

presentación explícita como “mejor opción”;

selección para un caso de uso concreto.

 

Reglas de exclusión

Los siguientes elementos NO constituyen automáticamente una recomendación:

simple mención;

descripción factual;

referencia histórica;

citación como fuente;

comparación neutral;

afirmación de que una entidad existe.

N/A

Cuando el formato de la respuesta no permita determinar razonablemente la existencia de una recomendación.

Incertidumbre

Los casos ambiguos NO DEBEN convertirse automáticamente en recomendaciones positivas.

Evaluación externa requerida

Sí, para los casos límite y para validar la regla de anotación.

Ground truth

Intención del usuario y definición de la tarea.

Criterio de validación

Los anotadores independientes deberían demostrar un nivel aceptable de acuerdo.

Riesgos de medición

ambigüedad de la recomendación;

dependencia de la intención;

preferencia implícita;

orden de las listas;

lenguaje retórico.

 

Prueba de reproducibilidad

Clasificación independiente de respuestas idénticas utilizando el mismo contexto de consulta.

Limitaciones

La recomendación no puede inferirse únicamente a partir de la presencia de una entidad.

Estado

Variable central de observación.

 

10. Posición

ID de variable

OV-REC-02

Nombre

Posición de la Recomendación

Definición operacional

Localización ordinal de una entidad recomendada dentro de una estructura de recomendaciones explícitamente ordenada.

Fenómeno representado

Posición relativa dentro de un conjunto ordenado de recomendaciones.

Evidencia requerida

Lista, ranking o estructura equivalente explícitamente ordenada.

Unidad de observación

Estructura de recomendación ordenada.

Unidad de análisis

Entidad recomendada.

Método de codificación

Registrar la posición ordinal de la entidad únicamente cuando exista un orden explícito.

Valores permitidos

Números enteros positivos comenzando en 1, siempre que la estructura sea realmente ordenada.

Reglas de inclusión

La posición PUEDE registrarse cuando:

las recomendaciones están numeradas;

el orden tiene significado semántico;

la respuesta distingue explícitamente primera, segunda, tercera, etc.

 

Reglas de exclusión

La posición NO DEBE inferirse únicamente a partir de:

aparición textual;

orden de los párrafos;

orden de las citas;

formato arbitrario.

N/A

Cuando no exista un orden defendible.

Incertidumbre

Cuando el orden sea ambiguo, la posición DEBE registrarse como N/A en lugar de estimarse.

Evaluación externa requerida

No para orden explícito; sí para validar estructuras ambiguas.

Ground truth

Orden explícito de la respuesta.

Criterio de validación

Acuerdo entre anotadores independientes.

Riesgos de medición

inferencia falsa de prominencia;

diferencias de formato;

listas no ordenadas;

respuestas narrativas.

Prueba de reproducibilidad

Codificación independiente de la posición.

Limitaciones

La posición no equivale a calidad de recomendación ni a preferencia del usuario.

Estado

Variable central condicional.

 

10. Variables de evidencia

 

11.1 Presencia de fuente

ID de variable

OV-EVD-01

Nombre

Presencia de Fuente

Definición operacional

Determina si la respuesta de IA proporciona fuentes externas o citas identificables que respalden afirmaciones relacionadas con la entidad objetivo.

Fenómeno representado

Trazabilidad de las afirmaciones generadas por IA hacia información externa.

Evidencia requerida

Fuente visible, cita, enlace, atribución o evidencia identificable equivalente.

Unidad de observación

Respuesta.

Unidad de análisis

Afirmación o relación entidad-respuesta.

Método de codificación

Determinar si existe evidencia de respaldo identificable.

Valores permitidos

Presente

Ausente

N/A

Reglas de inclusión

Una fuente cualifica cuando puede identificarse suficientemente para una inspección posterior.

Reglas de exclusión

Las afirmaciones sin respaldo identificable no deben considerarse fuentes.

N/A

Cuando el formato de la respuesta no permita identificar razonablemente una fuente.

Incertidumbre

Las referencias incompletas o no resolubles DEBERÍAN marcarse.

Evaluación externa requerida

No para determinar presencia; sí para evaluar calidad de la fuente.

Ground truth

Identidad de la fuente mostrada en la respuesta.

Criterio de validación

Clasificación independiente de presencia de fuente.

Riesgos de medición

citas inaccesibles;

referencias truncadas;

fuentes implícitas;

citas generadas por el sistema.

Prueba de reproducibilidad

Identificación independiente de las fuentes.

Limitaciones

La presencia de una fuente no demuestra calidad ni exactitud factual.

Estado

Variable central de observación.

 

11.2 Autoridad de la fuente

ID de variable

OV-EVD-02

Nombre

Autoridad de la Fuente

Definición operacional

Credibilidad o autoridad de la fuente que respalda una afirmación, evaluada mediante criterios externos.

Fenómeno representado

Calidad del respaldo evidencial.

Evidencia requerida

Fuente identificable más un criterio de evaluación externa aplicable.

Unidad de observación

Relación fuente-afirmación.

Unidad de análisis

Fuente individual.

Método de codificación

La autoridad de la fuente DEBE evaluarse mediante un protocolo externo de autoridad definido por separado.

Valores permitidos

Todavía no fijados en Framework 0.1.

El framework NO DEBE introducir una escala arbitraria de autoridad sin validación.

Reglas de inclusión

Solo pueden evaluarse fuentes identificables.

Reglas de exclusión

No debe inferirse autoridad a partir de:

el nombre del dominio por sí solo;

la presencia de una cita;

la posición de la fuente en la respuesta;

la familiaridad de la marca.

N/A

Cuando no exista una fuente identificable o no pueda evaluarse su autoridad mediante el protocolo adoptado.

Incertidumbre

Las evaluaciones de autoridad DEBERÍAN conservar la incertidumbre del evaluador.

Evaluación externa requerida

Sí.

Ground truth

Criterios externos de calidad de fuentes.

Criterio de validación

Acuerdo entre evaluadores independientes que utilicen el mismo protocolo.

Riesgos de medición

sesgo por dominio;

subjetividad del evaluador;

cambios temporales en la calidad de la fuente;

autoridad específica por sector.

Prueba de reproducibilidad

Evaluación ciega e independiente de las fuentes.

Limitaciones

La autoridad no equivale a corrección factual.

Estado

Variable de evaluación; derivación de métrica aplazada hasta validación.

 

12. Exactitud

ID de variable

OV-EVL-01

Nombre

Exactitud

Definición operacional

Grado en que una afirmación factual realizada por el sistema de IA se corresponde con un estado de referencia establecido o con evidencia externa verificada.

Fenómeno representado

Corrección factual de la representación.

Evidencia requerida

Afirmación de la IA más evidencia de referencia establecida independientemente.

Unidad de observación

Afirmación.

Unidad de análisis

Par afirmación-referencia.

Método de codificación

Primero deben identificarse las afirmaciones y posteriormente evaluarse frente a un ground truth aplicable.

Valores permitidos

La escala final no se fija en Framework 0.1.

Reglas de inclusión

Solo deberían evaluarse afirmaciones para las que exista un procedimiento de verificación adecuado.

Reglas de exclusión

No deben evaluarse como afirmaciones factuales:

opiniones puras;

preferencias subjetivas sin referencia definida;

afirmaciones sin evidencia suficiente para su verificación.

N/A

Cuando no exista un ground truth defendible.

Incertidumbre

Las afirmaciones inciertas DEBEN conservar un estado de incertidumbre en lugar de forzarse a correcto/incorrecto.

Evaluación externa requerida

Sí.

Ground truth

Requerido cuando sea posible realizar una validación factual.

Criterio de validación

Correspondencia con evidencia de referencia establecida independientemente.

Riesgos de medición

ground truth incompleto;

información cambiante;

afirmaciones ambiguas;

desacuerdo entre evaluadores.

Prueba de reproducibilidad

Verificación independiente de las afirmaciones.

Limitaciones

La exactitud no equivale a calidad de recomendación, autoridad de la fuente o visibilidad.

Estado

Variable de evaluación; derivación de métrica aplazada.

 

13. Fidelidad

ID de variable

OV-EVL-02

Nombre

Fidelidad

Definición operacional

Grado en que la representación realizada por el sistema de IA mantiene el significado de la evidencia o fuente de la que procede, sin introducir una distorsión material.

Fenómeno representado

Fidelidad de la representación frente a su fuente.

Evidencia requerida

Representación de la IA más material de referencia frente al cual pueda evaluarse la fidelidad.

Unidad de observación

Afirmación o relación representación-fuente.

Unidad de análisis

Representación generada por IA.

Método de codificación

Identificar las afirmaciones relevantes, identificar la evidencia correspondiente en la fuente y evaluar si la representación conserva su significado sin distorsión material.

Valores permitidos

Todavía no fijados.

Reglas de inclusión

La evaluación de fidelidad requiere una base de comparación identificable.

Reglas de exclusión

La fidelidad no debe inferirse simplemente porque una afirmación parezca plausible o sea factual.

N/A

Cuando no exista una fuente de comparación.

Incertidumbre

Las paráfrasis ambiguas DEBERÍAN marcarse.

Evaluación externa requerida

Sí.

Ground truth

Material de referencia.

Criterio de validación

Evaluación independiente de la fidelidad.

Riesgos de medición

interpretación semántica;

efectos de resumen;

ambigüedad de la fuente;

subjetividad del evaluador.

Prueba de reproducibilidad

Comparación ciega realizada por evaluadores independientes.

Limitaciones

Fidelidad y exactitud están relacionadas, pero constituyen constructos distintos.

Estado

Variable de evaluación; derivación de métrica aplazada.

 

14. Validez

ID de variable

OV-EVL-03

Nombre

Validez

Definición operacional

Grado en que una representación o recomendación generada por IA resulta adecuada para la tarea, intención o constructo definido.

Fenómeno representado

Validez de constructo/tarea, diferenciada de la mera corrección factual.

Evidencia requerida

Respuesta, intención del usuario, definición de la tarea y criterios de evaluación aplicables.

Unidad de observación

Respuesta o afirmación respecto de una tarea.

Unidad de análisis

Relación respuesta-tarea.

Método de codificación

Evaluar si la respuesta aborda realmente el constructo que se pretende medir.

Valores permitidos

Todavía no fijados.

Reglas de inclusión

La validez requiere una tarea o constructo previamente definido.

Reglas de exclusión

La validez no debe equipararse con:

exactitud factual;

recomendación;

autoridad de la fuente.

N/A

Cuando el constructo no pueda evaluarse a partir de la evidencia disponible.

Incertidumbre

Las interpretaciones inciertas del constructo DEBEN registrarse.

Evaluación externa requerida

Sí.

Ground truth

Especificación de la tarea y definición del constructo.

Criterio de validación

Evaluación independiente y validación del constructo.

Riesgos de medición

ambigüedad del constructo;

sesgo del evaluador;

confusión con exactitud;

dependencia de la tarea.

Prueba de reproducibilidad

Evaluación independiente utilizando definiciones idénticas de la tarea.

Limitaciones

La validez depende inherentemente del constructo que se pretende medir.

Estado

Variable de evaluación; derivación de métrica aplazada.

 

15. Variables entre modelos

 

15.1 Cobertura de motores

ID de variable

OV-CMP-01

Nombre

Cobertura de Motores

Definición operacional

Presencia de un fenómeno observable definido dentro del conjunto de sistemas de IA incluidos en un estudio de medición.

Fenómeno representado

Distribución de la visibilidad entre sistemas de IA.

Evidencia requerida

Observaciones comparables procedentes de cada sistema incluido.

Unidad de observación

Respuesta de un sistema de IA.

Unidad de análisis

Entidad objetivo dentro del conjunto de modelos definido.

Método de codificación

Primero se establece la observación relevante para cada sistema. La cobertura se deriva posteriormente de dichas observaciones.

Valores permitidos

Las observaciones subyacentes DEBEN conservarse.

La escala normalizada final no se fija en Framework 0.1.

Reglas de inclusión

Solo pueden contribuir los sistemas de IA incluidos previamente en el diseño experimental.

Reglas de exclusión

Las observaciones no disponibles no deben tratarse como observaciones negativas.

N/A

Cuando el universo de modelos no esté definido o existan observaciones insuficientes.

Incertidumbre

Las observaciones ausentes DEBEN mantenerse diferenciadas de las observaciones negativas.

Evaluación externa requerida

No en el nivel de observación.

Ground truth

Universo de modelos previamente definido.

Criterio de validación

Protocolo reproducible de inclusión de modelos y observación.

Riesgos de medición

disponibilidad del modelo;

diferencias de versión;

observaciones ausentes;

condiciones de respuesta desiguales.

Prueba de reproducibilidad

Replicación independiente utilizando el mismo universo de modelos.

Limitaciones

La cobertura es una variable derivada y depende de la calidad de las observaciones subyacentes.

Estado

Candidata a métrica derivada.

 

15.2 Frecuencia

ID de variable

OV-CMP-02

Nombre

Frecuencia de Recomendación / Visibilidad

Definición operacional

Recurrencia de un fenómeno observable definido a través de observaciones repetidas realizadas bajo un protocolo experimental previamente establecido.

Fenómeno representado

Reaparición del fenómeno frente a una presencia aislada.

Evidencia requerida

Múltiples observaciones registradas independientemente bajo condiciones comparables.

Unidad de observación

Ensayo experimental.

Unidad de análisis

Fenómeno objetivo a través de los ensayos.

Método de codificación

Cada ensayo se codifica independientemente. La frecuencia se deriva posteriormente de las observaciones obtenidas.

Valores permitidos

Los recuentos brutos de ocurrencias DEBERÍAN conservarse.

La normalización final y el denominador permanecen provisionales.

Reglas de inclusión

Los ensayos deben cumplir el protocolo experimental definido.

Reglas de exclusión

No deben combinarse observaciones generadas bajo condiciones materialmente diferentes sin registrar dichas diferencias.

N/A

Cuando el experimento contenga un número insuficiente de observaciones válidas.

Incertidumbre

La incertidumbre muestral DEBE conservarse.

Evaluación externa requerida

No necesariamente.

Ground truth

Protocolo experimental.

Criterio de validación

Replicación bajo el mismo protocolo.

Riesgos de medición

tamaño de muestra;

variación de prompts;

comportamiento estocástico;

efectos temporales;

elección del denominador.

Prueba de reproducibilidad

Muestreo repetido e independiente.

Limitaciones

La frecuencia es una propiedad tanto del comportamiento observado como del protocolo mediante el cual se mide.

Estado

Candidata a métrica derivada; denominador y protocolo de muestreo aún no resueltos.

 

16. Variables comparativas

 

16.1 Acuerdo

ID de variable

OV-CMP-03

Nombre

Acuerdo entre Modelos

Definición operacional

Grado en que diferentes sistemas de IA evaluados independientemente producen clasificaciones equivalentes para un mismo fenómeno definido bajo condiciones experimentales comparables.

Fenómeno representado

Convergencia entre sistemas de IA.

Evidencia requerida

Observaciones codificadas comparables procedentes de múltiples sistemas.

Unidad de observación

Resultado codificado a nivel de modelo.

Unidad de análisis

Fenómeno a través de modelos.

Método de codificación

El acuerdo DEBE evaluarse separadamente por dimensión.

Valores permitidos

No se fija una escala universal de acuerdo en Framework 0.1.

Reglas de inclusión

Solo pueden utilizarse observaciones comparables.

Reglas de exclusión

La similitud textual superficial no debe considerarse automáticamente acuerdo.

N/A

Cuando no existan suficientes observaciones comparables.

Incertidumbre

Las diferencias atribuibles a incertidumbre de anotación DEBEN distinguirse, cuando sea posible, de las divergencias reales entre modelos.

Evaluación externa requerida

Potencialmente, para validar la base de codificación.

Ground truth

El protocolo de codificación compartido, no un modelo individual.

Criterio de validación

El acuerdo debe ser reproducible en análisis independientes.

Riesgos de medición

diferencias de constructo;

efectos del prompt;

diferencias entre modelos;

desacuerdo de anotación.

Prueba de reproducibilidad

Codificación independiente entre modelos.

Limitaciones

El acuerdo no implica corrección.

Estado

Variable comparativa; derivación de métrica aplazada.

 

16.2 Divergencia

ID de variable

OV-CMP-04

Nombre

Divergencia entre Modelos

Definición operacional

Grado en que diferentes sistemas de IA producen clasificaciones o representaciones materialmente diferentes para un mismo fenómeno definido bajo condiciones comparables.

Fenómeno representado

Desacuerdo entre modelos.

Evidencia requerida

Observaciones comparables entre sistemas.

Unidad de observación

Resultado a nivel de modelo.

Unidad de análisis

Fenómeno entre modelos.

Método de codificación

La divergencia se deriva de observaciones codificadas comparables y DEBE interpretarse dimensión por dimensión.

Valores permitidos

No se fija una escala universal de divergencia en Framework 0.1.

Reglas de inclusión

Solo pueden compararse observaciones suficientemente equivalentes.

Reglas de exclusión

No debe interpretarse cualquier diferencia textual como divergencia metodológica.

N/A

Cuando la comparación no sea posible.

Incertidumbre

El posible desacuerdo de anotación DEBE registrarse por separado.

Evaluación externa requerida

No necesariamente.

Ground truth

Protocolo de medición compartido.

Criterio de validación

Comparación reproducible entre modelos.

Riesgos de medición

sensibilidad al prompt;

versión del modelo;

estocasticidad;

diferencias de anotación.

Prueba de reproducibilidad

Replicación independiente de la comparación entre modelos.

Limitaciones

La divergencia es descriptiva. No establece qué modelo es correcto.

Estado

Variable comparativa; derivación de métrica aplazada.

 

17. Variables deliberadamente excluidas de Metrics Framework 0.1

La Architecture Review identificó varios constructos para los que la evidencia o la definición operacional todavía no presentan suficiente madurez.

Por tanto, no se convierten en métricas en esta versión.

Entre ellos:

Volatilidad;

Persistencia;

Absorción;

Influencia;

otros constructos temporales que requieran evidencia longitudinal.

Estas variables permanecen dentro de la arquitectura de investigación de AVM™, pero no son métricas operativas en Framework 0.1.

La distinción es deliberada.

No medir todavía no significa que una variable no sea relevante.

Significa que la metodología actual todavía no proporciona evidencia suficiente para medirla de forma reproducible.

 

17. Reglas transversales de medición

 

18.1 ¿Qué cuenta como respuesta?

Una respuesta es la salida completa generada por la IA asociada a un ensayo experimental definido.

El registro original DEBERÍA conservarse sin modificaciones sustanciales.

Pueden realizarse transformaciones de formato para el análisis, pero la respuesta original DEBE permanecer disponible para auditoría.

 

19. ¿Qué cuenta como mención?

Una mención requiere una referencia textual identificable a la entidad objetivo.

La mención NO DEBE inferirse únicamente a partir de similitud semántica.

Los alias y abreviaturas pueden considerarse menciones cuando puedan mapearse inequívocamente a la entidad objetivo.

 

20. ¿Qué cuenta como recomendación?

La recomendación requiere una relación entre:

entidad + intención del usuario + afirmación de preferencia o selección

Por tanto:

Mención ≠ Recomendación

y:

Descripción ≠ Recomendación

Una comparación neutral NO DEBE considerarse automáticamente una recomendación.

 

21. Identificación de entidades

La identificación de la entidad DEBE realizarse antes de medir las variables relacionadas con la entidad.

El proceso de anotación DEBERÍA establecer:

entidad objetivo;

alias conocidos;

criterios de desambiguación;

aparición de la entidad;

confianza en la identificación.

Esto evita que las métricas posteriores se contaminen por una identificación incorrecta.

 

22. Presencia frente a prioridad

AVM™ DEBE distinguir entre:

Presencia

y:

Prioridad

Una entidad puede estar presente sin ser recomendada.

Una entidad puede ser recomendada sin ser la recomendación principal.

Una entidad puede ocupar la primera posición de una lista sin que la respuesta establezca explícitamente que dicha posición representa preferencia.

Por tanto, la posición NO DEBE interpretarse automáticamente como prioridad.

 

23. Listas y rankings

Las listas DEBEN clasificarse según si su orden tiene significado semántico.

Pueden constituir orden explícito:

recomendaciones numeradas;

listas clasificadas;

“mejor”, “segunda mejor”, etc.;

alternativas explícitamente ordenadas.

NO deben considerarse automáticamente rankings:

secuencia de párrafos;

orden de las citas;

orden alfabético;

orden arbitrario de viñetas.

 

24. Codificación de posición

La posición DEBERÍA registrarse únicamente cuando el orden sea explícito.

Cuando no exista un orden defendible:

Posición = N/A

La metodología NO DEBE estimar la posición a partir de intuiciones visuales o textuales.

Esto protege la distinción entre:

orden observado

y:

prominencia inferida.

 

25. Respuestas ambiguas

Las observaciones ambiguas NO DEBEN convertirse automáticamente en clasificaciones positivas o negativas.

El framework establece como mínimo la distinción entre:

observable;

no observable;

ambiguo;

N/A.

Las observaciones ambiguas DEBERÍAN conservarse para su posterior adjudicación.

 

26. Respuestas contradictorias

Si una misma respuesta contiene afirmaciones contradictorias sobre la misma entidad objetivo, la contradicción DEBE conservarse en el registro de evidencia.

El evaluador NO DEBERÍA seleccionar silenciosamente la interpretación que produzca el valor de métrica preferido.

Cuando sea necesario, la respuesta PUEDE generar múltiples observaciones a nivel de afirmación.

 

27. Ausencia

La ausencia no equivale a dato faltante.

El framework distingue entre:

Ausencia observada

No existe una observación válida

y:

N/A

Por ejemplo:

entidad no mencionada → ausencia observable;

respuesta no disponible → observación faltante;

estado de la entidad no determinable → N/A.

Estos estados NO DEBEN combinarse.

 

28. Tratamiento de N/A

N/A significa:

La variable no puede evaluarse válidamente bajo las condiciones de observación aplicables.

N/A NO DEBE convertirse automáticamente en cero.

La razón del N/A DEBERÍA registrarse siempre que sea posible.

 

29. Incertidumbre

La incertidumbre DEBERÍA representarse explícitamente cuando la evidencia no permita una clasificación determinista.

El framework distingue entre:

incertidumbre de medición;

incertidumbre de anotación;

incertidumbre de fuente;

incertidumbre del ground truth;

incertidumbre experimental.

El tratamiento de la incertidumbre DEBE definirse antes de introducir cualquier puntuación compuesta.

 

30. Evaluación externa

Algunas variables pueden establecerse directamente a partir de la respuesta.

Otras requieren una referencia externa.

El framework distingue, por tanto, entre:

Observación directa

Ejemplos:

presencia de entidad;

mención;

presencia de fuente;

posición explícita.

Evaluación externa

Ejemplos:

autoridad de la fuente;

exactitud;

fidelidad;

validez.

Las variables del segundo grupo NO DEBEN tratarse como si fueran directamente observables en la respuesta de IA.

 

31. Ground truth

El ground truth es necesario cuando una variable afirma correspondencia con una realidad externa o con un estado de referencia.

Ejemplo:

Afirmación de IA

Evidencia de referencia

Evaluación

El ground truth DEBE estar documentado suficientemente para permitir su auditoría.

Cuando no exista un ground truth defendible, el resultado apropiado PUEDE ser:

N/A

en lugar de una evaluación sin fundamento.

 

32. Protocolo de anotación

La implementación definitiva de AVM™ Metrics Framework 0.1 DEBERÍA utilizar un protocolo de anotación estandarizado.

Como mínimo, el protocolo DEBERÍA especificar:

qué recibe el anotador;

qué información permanece oculta;

qué constituye evidencia;

qué valores están permitidos;

cómo se gestionan los casos ambiguos;

cuándo puede utilizarse N/A;

cuándo se realiza adjudicación;

cómo se registran los desacuerdos.

Los anotadores NO DEBERÍAN inferir información que no esté disponible en el registro de observación definido.

 

33. Requisito de reproducibilidad

Una medición es reproducible únicamente cuando otro investigador cualificado puede aplicar el mismo protocolo a la misma evidencia y obtener un resultado materialmente equivalente.

Por tanto:

La reproducibilidad forma parte de la propia definición de la medición.

No es un procedimiento opcional de control de calidad que se añade posteriormente.

 

34. Prueba de reproducibilidad

El protocolo de validación de Framework 0.1 DEBERÍA incluir al menos:

Test A — Anotación independiente

Dos o más anotadores codifican independientemente observaciones idénticas.

Test B — Anotación ciega

Los anotadores no conocen las decisiones de los demás.

Test C — Adjudicación

Los desacuerdos se registran y resuelven mediante reglas previamente definidas.

Test D — Replicación

Un investigador independiente repite el procedimiento utilizando la misma especificación.

Test E — Sensibilidad de las reglas

Los casos límite se utilizan para identificar variables cuya clasificación depende excesivamente de interpretaciones subjetivas.

El objetivo no es forzar artificialmente el acuerdo.

El objetivo es descubrir dónde la metodología todavía está insuficientemente especificada.

 

35. Auditabilidad

Toda medición derivada DEBERÍA poder rastrearse mediante la siguiente cadena:

Métrica

Observación(es) subyacente(s)

Variable(s) codificada(s)

Evidencia

Respuesta original

Contexto experimental

Una medición que no pueda rastrearse hacia atrás mediante esta cadena está metodológicamente incompleta.

 

36. Metadatos del modelo y del experimento

Toda observación experimental DEBERÍA registrar, cuando esté disponible:

proveedor de IA;

modelo;

versión del modelo;

interfaz/API;

fecha;

hora;

prompt;

condiciones del sistema;

temperatura u otro parámetro de generación equivalente, cuando esté disponible;

idioma;

configuración regional;

estado relevante de herramientas/búsqueda;

respuesta.

Esto es necesario porque las respuestas generadas por IA pueden variar según las condiciones experimentales.

 

37. No determinismo

Los sistemas de IA pueden generar respuestas diferentes ante el mismo prompt.

Por tanto:

Una respuesta es una observación, no necesariamente el fenómeno en sí mismo.

Pueden ser necesarias observaciones repetidas cuando la pregunta de investigación se refiere a recurrencia, estabilidad o frecuencia.

Las decisiones de muestreo DEBEN documentarse antes de calcular métricas derivadas.

 

38. Disciplina del denominador

No debe introducirse un denominador simplemente porque resulte conveniente expresar un resultado como porcentaje.

Antes de definir una tasa o métrica normalizada, AVM™ DEBE especificar:

numerador;

denominador;

criterios de elegibilidad;

tratamiento de observaciones faltantes;

tratamiento de N/A;

unidad de muestreo;

supuestos sobre independencia de las observaciones.

Este requisito es especialmente importante para Frecuencia y Cobertura de Motores.

 

39. Comparabilidad entre modelos

Las comparaciones entre sistemas de IA DEBERÍAN realizarse únicamente cuando las observaciones subyacentes sean suficientemente comparables.

El experimento DEBERÍA controlar, cuando sea posible:

prompts equivalentes;

intención de usuario equivalente;

condiciones de modelo comparables;

entidades objetivo equivalentes;

ventanas temporales equivalentes;

reglas de anotación equivalentes.

Las diferencias en las condiciones experimentales NO DEBEN interpretarse automáticamente como diferencias entre modelos.

 

40. Lo que Framework 0.1 no define

Este documento deliberadamente NO define:

AVM™ Score;

ponderaciones;

índices compuestos;

normalización definitiva;

escalas universales 0–100;

puntuaciones de impacto empresarial;

atribución de ingresos;

influencia causal;

ranking definitivo de modelos;

métricas definitivas de persistencia temporal.

Estos elementos requieren evidencia que todavía no está disponible.

 

41. Estado de investigación de las métricas

El framework produce actualmente tres clases metodológicas.

Clase A — Observables / Codificables

Variables que pueden establecerse directamente a partir de la respuesta mediante reglas definidas.

Ejemplos:

Identificación de Entidad;

Mención de Entidad;

Representación;

Recomendación;

Posición;

Presencia de Fuente.

Clase B — Evaluativas

Variables que requieren criterios externos o ground truth.

Ejemplos:

Autoridad de la Fuente;

Exactitud;

Fidelidad;

Validez.

Clase C — Derivadas / Comparativas

Variables que requieren múltiples observaciones.

Ejemplos:

Frecuencia;

Cobertura de Motores;

Acuerdo;

Divergencia.

Esta clasificación es importante porque las tres clases requieren procedimientos de validación diferentes.

 

42. Estado provisional de las métricas

En la versión 0.1, el framework no afirma que todas las métricas candidatas estén ya validadas.

Cada métrica recibe, en cambio, un estado metodológico:

PROVISIONAL

significa que existe una definición operacional pero requiere validación empírica.

VALIDACIÓN REQUERIDA

significa que el procedimiento de medición necesita un experimento específico de validación.

DERIVACIÓN APLAZADA

significa que las observaciones subyacentes están reconocidas, pero el tratamiento matemático definitivo se pospone deliberadamente.

CORE

significa que la variable pertenece actualmente a la arquitectura de medición propuesta.

 

43. Principio metodológico central

AVM™ Metrics Framework 0.1 adopta el siguiente principio:

Una métrica no se define por el número asignado a una observación. Se define por el procedimiento reproducible que transforma la evidencia en ese número.

Por tanto:

Evidencia

Regla operacional

Codificación

Medición

debe especificarse antes de introducir:

Score

 

44. Falsabilidad experimental

El framework está diseñado deliberadamente para poder ser falsado.

Una prueba válida de AVM™ Metrics Framework 0.1 no consiste simplemente en comprobar si las mediciones resultantes parecen plausibles.

La prueba más exigente es:

¿Pueden investigadores independientes aplicar la especificación a la misma evidencia y obtener mediciones materialmente equivalentes?

Si no pueden, el framework habrá identificado una debilidad metodológica.

Esa debilidad DEBERÍA conducir a:

Observación

Desacuerdo

Análisis de la regla

Revisión del framework

Nueva validación

y no a un ajuste retrospectivo de los resultados.

 

45. Próximo experimento de validación

La siguiente fase experimental DEBERÍA diseñarse específicamente alrededor de la reproducibilidad.

El experimento DEBERÍA proporcionar:

conjunto fijo de prompts;

conjunto fijo de sistemas de IA;

conjunto fijo de entidades objetivo;

respuestas originales conservadas;

Metrics Framework 0.1;

anotadores independientes;

anotación ciega;

registro de desacuerdos;

adjudicación;

análisis de reproducibilidad.

El objetivo no es demostrar que AVM™ es correcto.

Es identificar dónde AVM™ 0.1 está insuficientemente especificado.

 

46. Criterios de aceptación de Framework 0.1

Antes de promocionar una variable a métrica validada, AVM™ DEBERÍA demostrar que:

su fenómeno puede identificarse;

la evidencia requerida está definida;

la regla de codificación es explícita;

los valores permitidos son conocidos;

existen reglas de inclusión y exclusión;

N/A está definido;

la incertidumbre puede registrarse;

los requisitos de evaluación externa están definidos;

los requisitos de ground truth están definidos cuando corresponda;

investigadores independientes pueden reproducir la clasificación;

los desacuerdos pueden diagnosticarse;

las limitaciones están documentadas.

Solo entonces la variable debería pasar a la derivación formal de la métrica.

 

47. Transición hacia AVM™ Metrics Framework 0.2

Los resultados del experimento de reproducibilidad DEBERÍAN producir la siguiente revisión.

Los resultados potenciales incluyen:

Framework 0.1

      ↓

Prueba de reproducibilidad

      ↓

│ Medición       │ Medición       │ Medición        │

│ estable        │ ambigua        │ inválida        │

        ↓                ↓                 ↓

    Mantener         Redefinir         Eliminar/

                                       Aplazar

                    ↓

              Metrics Framework 0.2

 

Esto convierte el versionado en parte de la metodología y no únicamente en una convención editorial.

 

48. Conclusión final

AVM™ Metrics Framework 0.1 establece el puente operativo entre las variables observables de OVF 0.2 y el futuro sistema de medición de AVM™.

Su principal contribución no es un score.

Es una disciplina de medición.

El framework establece que:

Lo que produce la IA debe convertirse primero en un fenómeno observable.

Después:

El fenómeno debe codificarse mediante reglas explícitas.

Después:

La codificación debe ser reproducible.

Después:

La observación resultante puede transformarse en una métrica.

Y solo después:

Las métricas pueden compararse o, eventualmente, combinarse.

La cadena metodológica queda definida así:

RESPUESTA DE IA

OBSERVACIÓN

EVIDENCIA

CODIFICACIÓN

EVALUACIÓN

MÉTRICA

COMPARACIÓN

VALIDACIÓN

AVM™ SCORE

El framework se detiene deliberadamente antes de la última etapa.

No se introducen ponderaciones.

No se introduce un score compuesto.

No se define todavía AVM™ Score.

La siguiente tarea es empírica:

Intentar reproducir las mediciones y buscar deliberadamente situaciones en las que la especificación falle.

Si el framework supera esa prueba, las métricas resultantes no serán simplemente plausibles.

Habrán demostrado una propiedad metodológica mucho más importante:

Pueden ser medidas por alguien distinto de su autor, a partir de la misma evidencia, utilizando las mismas reglas y obteniendo un resultado documentado y explicable.

Ese es el umbral que AVM™ debe superar antes de que pueda considerarse metodológicamente defendible cualquier puntuación numérica de visibilidad.

 

Estado del documento

AVM™ Metrics Framework 0.1

Estado: Experimental / Provisional

Depende de: OVF 0.2 y AVM™ Metrics Architecture Review 0.1

Siguiente etapa: Experimento de Reproducibilidad y Falsación

Todavía no definido: AVM™ Score, ponderaciones, normalización y scoring de madurez

Principio metodológico:

Medir únicamente aquello que puede observarse, codificarse, reproducirse y auditarse.

 

 

Manu Duque
AI Visibility Specialist
ai-visibility.es

 

Sinopsis Fundacional AVM™ & PCI™

  De la observación de la AI Visibility a la investigación de su dinámica y capacidad predictiva Estado: Documento fundacional Función: Marco conceptual de los proyectos AVM™ y PCI™ Ámbito: AI Visibility Measurement & Predictive AI Visibility Research

Leer más »
Manu Duque
Resumen de privacidad

Esta web utiliza cookies para que podamos ofrecerte la mejor experiencia de usuario posible. La información de las cookies se almacena en tu navegador y realiza funciones tales como reconocerte cuando vuelves a nuestra web o ayudar a nuestro equipo a comprender qué secciones de la web encuentras más interesantes y útiles.

Nunca almacenamos información personal.

Puedes revisar nuestra política en la página de Política de Privacidad, Condiciones de Uso y Cookies.