Especificación de Medición Reproducible
Estado: Especificación experimental
Versión: 0.1
Arquitectura de referencia: AVM™ Metrics Architecture Review 0.1
Modelo de entrada: OVF 0.2 — Observable Variables Framework
Ámbito: Medición de la Visibilidad IA en sistemas de inteligencia artificial
Exclusiones: AVM™ Score, ponderaciones, scoring compuesto y scoring de madurez
1. Propósito
AVM™ Metrics Framework 0.1 define la primera especificación operativa para transformar las variables observables identificadas en OVF 0.2 en mediciones que puedan ser reproducidas, inspeccionadas y auditadas de forma independiente.
El propósito de este documento no es establecer un sistema definitivo de puntuación.
Su propósito es más fundamental y específico:
Especificar cómo debe identificarse, codificarse, evaluarse y registrarse un fenómeno observable antes de que pueda convertirse en una métrica.
El framework establece, por tanto, una capa metodológica intermedia entre:
Variable Observable
y
Métrica
La secuencia fundamental es:
Observación → Evidencia → Codificación → Evaluación → Medición
Solo después de validar esta secuencia deberían utilizarse las mediciones para realizar cálculos comparativos o compuestos.
2. Relación con OVF 0.2
OVF 0.2 estableció qué puede observarse en una respuesta de IA.
Metrics Framework 0.1 establece cómo pueden medirse esas observaciones.
La distinción es intencionada.
OVF pregunta:
¿Qué fenómeno está presente en la respuesta?
Metrics Framework pregunta:
¿Qué evidencia demuestra ese fenómeno, cómo se codifica y bajo qué condiciones puede reproducirse la medición?
Por tanto:
OVF 0.2
Variables Observables
│
▼
Metrics Framework 0.1
Medición Operativa
│
▼
Métricas Validadas
La presencia de una variable en OVF 0.2 no implica automáticamente que se convierta en una métrica.
Primero debe demostrar suficiente:
observabilidad;
codificabilidad;
reproducibilidad;
auditabilidad.
3. Principio de elegibilidad para la medición
Una variable solo debería convertirse en métrica cuando pueda demostrarse la siguiente cadena:
Observable → Codificable → Reproducible → Auditable → Métrica
Si alguna de estas condiciones no puede demostrarse en el estado actual del conocimiento, la variable podrá permanecer como:
variable auxiliar;
variable de evaluación;
variable de investigación;
variable aplazada;
o variable descartada.
Esto evita que el framework convierta distinciones conceptuales en valores numéricos sin suficiente respaldo metodológico.
4. Arquitectura de medición
AVM™ Metrics Framework 0.1 separa la medición en cinco capas.
CAPA 1
OBSERVACIÓN
¿Qué produce el sistema de IA?
↓
CAPA 2
CODIFICACIÓN
¿Qué fenómeno observable está presente?
↓
CAPA 3
EVALUACIÓN
¿La observación satisface un criterio externo?
↓
CAPA 4
DERIVACIÓN
¿Una o varias observaciones codificadas pueden
producir una medición reproducible?
↓
CAPA 5
COMPARACIÓN
¿Pueden compararse las mediciones entre
respuestas, consultas o sistemas de IA?
El framework no presupone que todas las variables deban pasar por las cinco capas.
Por ejemplo, Autoridad de la Fuente puede requerir una evaluación externa, mientras que Presencia de Entidad puede establecerse principalmente mediante observación directa.
5. Registro de medición
Toda observación utilizada para generar una medición AVM™ DEBERÍA conservar un registro mínimo de evidencia.
El registro DEBERÍA contener:
sistema de IA;
modelo/versión, cuando esté disponible;
consulta/prompt;
respuesta;
fecha y hora;
entidad objetivo;
segmento relevante de la respuesta;
variable codificada;
valor codificado;
ubicación de la evidencia;
identidad del evaluador o ID anonimizado;
estado de incertidumbre;
estado de adjudicación, cuando corresponda.
El objetivo es garantizar la trazabilidad.
Una métrica sin una observación recuperable no puede considerarse completamente auditable.
6. Formato de especificación de variables
Cada variable de este framework se especifica mediante la siguiente estructura:
ID de variable
Nombre
Definición operacional
Fenómeno representado
Evidencia requerida
Unidad de observación
Unidad de análisis
Método de codificación
Valores permitidos
Reglas de inclusión
Reglas de exclusión
Tratamiento de N/A
Tratamiento de la incertidumbre
Requisito de evaluación externa
Requisito de ground truth
Criterio de validación
Riesgos de medición
Prueba de reproducibilidad
Limitaciones
Estado
7. Variables centrales de observación
7.1 Identificación de entidad / marca
ID de variable
OV-ENT-01
Nombre
Identificación de Entidad
Definición operacional
Determina si la entidad objetivo puede identificarse inequívocamente en la respuesta generada por la IA.
La identificación requiere evidencia suficiente de que la respuesta se refiere a la entidad objetivo y no a otra entidad homónima, genérica o semánticamente relacionada.
Fenómeno representado
El reconocimiento explícito de la entidad objetivo por parte del sistema de IA.
Evidencia requerida
El segmento exacto de la respuesta en el que se identifica la entidad.
Unidad de observación
Una respuesta generada por IA.
Unidad de análisis
Entidad objetivo dentro de una respuesta.
Método de codificación
El evaluador determina si la respuesta contiene una referencia identificable a la entidad objetivo.
Valores permitidos
1 — Identificada
0 — No identificada
N/A — No puede determinarse
Reglas de inclusión
La identificación DEBERÍA codificarse cuando:
la entidad se menciona explícitamente;
se utiliza un equivalente inequívoco;
el contexto establece claramente la entidad objetivo.
Reglas de exclusión
La identificación NO DEBERÍA codificarse cuando:
la respuesta se refiere únicamente a la industria;
la respuesta describe una categoría genérica;
la entidad no puede distinguirse de otra;
la referencia es especulativa y no puede atribuirse con suficiente confianza.
N/A
N/A DEBERÍA utilizarse únicamente cuando la evidencia sea insuficiente para determinar si la referencia corresponde a la entidad objetivo.
Incertidumbre
Las identificaciones ambiguas DEBERÍAN marcarse en lugar de convertirse silenciosamente en identificaciones positivas.
Evaluación externa requerida
No, salvo que exista una disputa sobre la desambiguación de la entidad.
Ground truth
La definición de entidad objetivo establecida antes de la medición.
Criterio de validación
Los anotadores independientes DEBERÍAN alcanzar un nivel sustancial de acuerdo en la clasificación.
Riesgos de medición
ambigüedad de entidades;
alias;
variaciones ortográficas;
homónimos;
referencias indirectas;
interpretación contextual.
Prueba de reproducibilidad
Dos anotadores independientes clasifican la misma respuesta sin consultar las decisiones del otro.
Limitaciones
La identificación de una entidad no establece recomendación, calidad, exactitud ni prominencia.
Estado
Variable central de observación.
7.2 Mención de entidad
ID de variable
OV-ENT-02
Nombre
Mención de Entidad
Definición operacional
Presencia de una referencia textual explícita a la entidad objetivo dentro de la respuesta.
Fenómeno representado
Representación superficial de la entidad.
Evidencia requerida
La aparición textual exacta o un equivalente claramente identificable.
Unidad de observación
Respuesta.
Unidad de análisis
Ocurrencia de la entidad.
Método de codificación
Cada ocurrencia que cumpla los criterios podrá registrarse según las reglas establecidas en el protocolo de anotación.
Valores permitidos
En Framework 0.1:
Presente
Ausente
N/A
El número bruto de menciones PUEDE conservarse como dato observacional, pero todavía no se designa como componente definitivo de una puntuación.
Reglas de inclusión
Una mención cualifica cuando se refiere a la entidad objetivo.
Reglas de exclusión
No deben contabilizarse:
homónimos no relacionados;
términos genéricos de categoría;
referencias que no puedan vincularse a la entidad objetivo.
N/A
Solo cuando no pueda resolverse la identidad de la entidad.
Incertidumbre
Las referencias ambiguas DEBERÍAN marcarse para adjudicación.
Evaluación externa requerida
No.
Ground truth
Identidad de la entidad objetivo.
Criterio de validación
Los anotadores independientes deberían clasificar de forma consistente las menciones que cumplen los criterios.
Riesgos de medición
menciones repetidas;
pronombres;
alias;
abreviaturas;
desambiguación de entidades.
Prueba de reproducibilidad
Anotación independiente de respuestas idénticas.
Limitaciones
La mención no implica recomendación ni visibilidad positiva.
Estado
Variable central de observación.
8. Variables de representación
8.1 Representación
ID de variable
OV-REP-01
Nombre
Representación de Entidad
Definición operacional
Determina si la entidad objetivo está representada de forma sustantiva y no simplemente como una referencia textual aislada.
Fenómeno representado
El grado en que el sistema de IA incorpora la entidad al contenido semántico de la respuesta.
Evidencia requerida
Fragmento relevante de la respuesta que muestre el papel de la entidad.
Unidad de observación
Respuesta.
Unidad de análisis
Relación entidad-respuesta.
Método de codificación
El evaluador determina si la entidad está representada sustantivamente de acuerdo con reglas de anotación previamente definidas.
Valores permitidos
Sustantiva
Incidental
Ausente
N/A
Reglas de inclusión
La representación requiere algo más que una simple aparición textual.
Reglas de exclusión
Una mención aislada NO DEBERÍA considerarse automáticamente representación sustantiva.
N/A
Cuando la evidencia no permita distinguir entre representación incidental y sustantiva.
Incertidumbre
Los casos límite DEBEN marcarse.
Evaluación externa requerida
Potencialmente, dependiendo del protocolo definitivo de anotación.
Ground truth
No necesariamente requerido en la fase inicial de observación.
Criterio de validación
Acuerdo entre anotadores.
Riesgos de medición
interpretación subjetiva;
longitud de la respuesta;
dependencia contextual;
sesgo del evaluador.
Prueba de reproducibilidad
Codificación independiente utilizando instrucciones y evidencia idénticas.
Limitaciones
La representación sigue siendo conceptualmente distinta de la recomendación.
Estado
Variable central de observación; requiere validación operacional.
9. Variables de recomendación
9.1 Recomendación
ID de variable
OV-REC-01
Nombre
Recomendación
Definición operacional
Una respuesta contiene una recomendación cuando el sistema de IA presenta explícita o funcionalmente la entidad objetivo como una opción que el usuario debería considerar, seleccionar, utilizar, comprar, visitar, adoptar o preferir en relación con la intención planteada.
Fenómeno representado
Selección preferencial mediada por IA.
Evidencia requerida
El fragmento de la respuesta que establece la recomendación.
Unidad de observación
Respuesta.
Unidad de análisis
Entidad objetivo en relación con la intención del usuario.
Método de codificación
La recomendación DEBE determinarse a partir de:
la referencia a la entidad; y
la relación semántica entre la entidad y la consulta del usuario.
Valores permitidos
Recomendada
No recomendada
Ambigua
N/A
Reglas de inclusión
Una recomendación puede ser explícita o funcionalmente equivalente.
Ejemplos:
recomendación directa;
clasificación dentro de alternativas recomendadas;
presentación explícita como “mejor opción”;
selección para un caso de uso concreto.
Reglas de exclusión
Los siguientes elementos NO constituyen automáticamente una recomendación:
simple mención;
descripción factual;
referencia histórica;
citación como fuente;
comparación neutral;
afirmación de que una entidad existe.
N/A
Cuando el formato de la respuesta no permita determinar razonablemente la existencia de una recomendación.
Incertidumbre
Los casos ambiguos NO DEBEN convertirse automáticamente en recomendaciones positivas.
Evaluación externa requerida
Sí, para los casos límite y para validar la regla de anotación.
Ground truth
Intención del usuario y definición de la tarea.
Criterio de validación
Los anotadores independientes deberían demostrar un nivel aceptable de acuerdo.
Riesgos de medición
ambigüedad de la recomendación;
dependencia de la intención;
preferencia implícita;
orden de las listas;
lenguaje retórico.
Prueba de reproducibilidad
Clasificación independiente de respuestas idénticas utilizando el mismo contexto de consulta.
Limitaciones
La recomendación no puede inferirse únicamente a partir de la presencia de una entidad.
Estado
Variable central de observación.
10. Posición
ID de variable
OV-REC-02
Nombre
Posición de la Recomendación
Definición operacional
Localización ordinal de una entidad recomendada dentro de una estructura de recomendaciones explícitamente ordenada.
Fenómeno representado
Posición relativa dentro de un conjunto ordenado de recomendaciones.
Evidencia requerida
Lista, ranking o estructura equivalente explícitamente ordenada.
Unidad de observación
Estructura de recomendación ordenada.
Unidad de análisis
Entidad recomendada.
Método de codificación
Registrar la posición ordinal de la entidad únicamente cuando exista un orden explícito.
Valores permitidos
Números enteros positivos comenzando en 1, siempre que la estructura sea realmente ordenada.
Reglas de inclusión
La posición PUEDE registrarse cuando:
las recomendaciones están numeradas;
el orden tiene significado semántico;
la respuesta distingue explícitamente primera, segunda, tercera, etc.
Reglas de exclusión
La posición NO DEBE inferirse únicamente a partir de:
aparición textual;
orden de los párrafos;
orden de las citas;
formato arbitrario.
N/A
Cuando no exista un orden defendible.
Incertidumbre
Cuando el orden sea ambiguo, la posición DEBE registrarse como N/A en lugar de estimarse.
Evaluación externa requerida
No para orden explícito; sí para validar estructuras ambiguas.
Ground truth
Orden explícito de la respuesta.
Criterio de validación
Acuerdo entre anotadores independientes.
Riesgos de medición
inferencia falsa de prominencia;
diferencias de formato;
listas no ordenadas;
respuestas narrativas.
Prueba de reproducibilidad
Codificación independiente de la posición.
Limitaciones
La posición no equivale a calidad de recomendación ni a preferencia del usuario.
Estado
Variable central condicional.
10. Variables de evidencia
11.1 Presencia de fuente
ID de variable
OV-EVD-01
Nombre
Presencia de Fuente
Definición operacional
Determina si la respuesta de IA proporciona fuentes externas o citas identificables que respalden afirmaciones relacionadas con la entidad objetivo.
Fenómeno representado
Trazabilidad de las afirmaciones generadas por IA hacia información externa.
Evidencia requerida
Fuente visible, cita, enlace, atribución o evidencia identificable equivalente.
Unidad de observación
Respuesta.
Unidad de análisis
Afirmación o relación entidad-respuesta.
Método de codificación
Determinar si existe evidencia de respaldo identificable.
Valores permitidos
Presente
Ausente
N/A
Reglas de inclusión
Una fuente cualifica cuando puede identificarse suficientemente para una inspección posterior.
Reglas de exclusión
Las afirmaciones sin respaldo identificable no deben considerarse fuentes.
N/A
Cuando el formato de la respuesta no permita identificar razonablemente una fuente.
Incertidumbre
Las referencias incompletas o no resolubles DEBERÍAN marcarse.
Evaluación externa requerida
No para determinar presencia; sí para evaluar calidad de la fuente.
Ground truth
Identidad de la fuente mostrada en la respuesta.
Criterio de validación
Clasificación independiente de presencia de fuente.
Riesgos de medición
citas inaccesibles;
referencias truncadas;
fuentes implícitas;
citas generadas por el sistema.
Prueba de reproducibilidad
Identificación independiente de las fuentes.
Limitaciones
La presencia de una fuente no demuestra calidad ni exactitud factual.
Estado
Variable central de observación.
11.2 Autoridad de la fuente
ID de variable
OV-EVD-02
Nombre
Autoridad de la Fuente
Definición operacional
Credibilidad o autoridad de la fuente que respalda una afirmación, evaluada mediante criterios externos.
Fenómeno representado
Calidad del respaldo evidencial.
Evidencia requerida
Fuente identificable más un criterio de evaluación externa aplicable.
Unidad de observación
Relación fuente-afirmación.
Unidad de análisis
Fuente individual.
Método de codificación
La autoridad de la fuente DEBE evaluarse mediante un protocolo externo de autoridad definido por separado.
Valores permitidos
Todavía no fijados en Framework 0.1.
El framework NO DEBE introducir una escala arbitraria de autoridad sin validación.
Reglas de inclusión
Solo pueden evaluarse fuentes identificables.
Reglas de exclusión
No debe inferirse autoridad a partir de:
el nombre del dominio por sí solo;
la presencia de una cita;
la posición de la fuente en la respuesta;
la familiaridad de la marca.
N/A
Cuando no exista una fuente identificable o no pueda evaluarse su autoridad mediante el protocolo adoptado.
Incertidumbre
Las evaluaciones de autoridad DEBERÍAN conservar la incertidumbre del evaluador.
Evaluación externa requerida
Sí.
Ground truth
Criterios externos de calidad de fuentes.
Criterio de validación
Acuerdo entre evaluadores independientes que utilicen el mismo protocolo.
Riesgos de medición
sesgo por dominio;
subjetividad del evaluador;
cambios temporales en la calidad de la fuente;
autoridad específica por sector.
Prueba de reproducibilidad
Evaluación ciega e independiente de las fuentes.
Limitaciones
La autoridad no equivale a corrección factual.
Estado
Variable de evaluación; derivación de métrica aplazada hasta validación.
12. Exactitud
ID de variable
OV-EVL-01
Nombre
Exactitud
Definición operacional
Grado en que una afirmación factual realizada por el sistema de IA se corresponde con un estado de referencia establecido o con evidencia externa verificada.
Fenómeno representado
Corrección factual de la representación.
Evidencia requerida
Afirmación de la IA más evidencia de referencia establecida independientemente.
Unidad de observación
Afirmación.
Unidad de análisis
Par afirmación-referencia.
Método de codificación
Primero deben identificarse las afirmaciones y posteriormente evaluarse frente a un ground truth aplicable.
Valores permitidos
La escala final no se fija en Framework 0.1.
Reglas de inclusión
Solo deberían evaluarse afirmaciones para las que exista un procedimiento de verificación adecuado.
Reglas de exclusión
No deben evaluarse como afirmaciones factuales:
opiniones puras;
preferencias subjetivas sin referencia definida;
afirmaciones sin evidencia suficiente para su verificación.
N/A
Cuando no exista un ground truth defendible.
Incertidumbre
Las afirmaciones inciertas DEBEN conservar un estado de incertidumbre en lugar de forzarse a correcto/incorrecto.
Evaluación externa requerida
Sí.
Ground truth
Requerido cuando sea posible realizar una validación factual.
Criterio de validación
Correspondencia con evidencia de referencia establecida independientemente.
Riesgos de medición
ground truth incompleto;
información cambiante;
afirmaciones ambiguas;
desacuerdo entre evaluadores.
Prueba de reproducibilidad
Verificación independiente de las afirmaciones.
Limitaciones
La exactitud no equivale a calidad de recomendación, autoridad de la fuente o visibilidad.
Estado
Variable de evaluación; derivación de métrica aplazada.
13. Fidelidad
ID de variable
OV-EVL-02
Nombre
Fidelidad
Definición operacional
Grado en que la representación realizada por el sistema de IA mantiene el significado de la evidencia o fuente de la que procede, sin introducir una distorsión material.
Fenómeno representado
Fidelidad de la representación frente a su fuente.
Evidencia requerida
Representación de la IA más material de referencia frente al cual pueda evaluarse la fidelidad.
Unidad de observación
Afirmación o relación representación-fuente.
Unidad de análisis
Representación generada por IA.
Método de codificación
Identificar las afirmaciones relevantes, identificar la evidencia correspondiente en la fuente y evaluar si la representación conserva su significado sin distorsión material.
Valores permitidos
Todavía no fijados.
Reglas de inclusión
La evaluación de fidelidad requiere una base de comparación identificable.
Reglas de exclusión
La fidelidad no debe inferirse simplemente porque una afirmación parezca plausible o sea factual.
N/A
Cuando no exista una fuente de comparación.
Incertidumbre
Las paráfrasis ambiguas DEBERÍAN marcarse.
Evaluación externa requerida
Sí.
Ground truth
Material de referencia.
Criterio de validación
Evaluación independiente de la fidelidad.
Riesgos de medición
interpretación semántica;
efectos de resumen;
ambigüedad de la fuente;
subjetividad del evaluador.
Prueba de reproducibilidad
Comparación ciega realizada por evaluadores independientes.
Limitaciones
Fidelidad y exactitud están relacionadas, pero constituyen constructos distintos.
Estado
Variable de evaluación; derivación de métrica aplazada.
14. Validez
ID de variable
OV-EVL-03
Nombre
Validez
Definición operacional
Grado en que una representación o recomendación generada por IA resulta adecuada para la tarea, intención o constructo definido.
Fenómeno representado
Validez de constructo/tarea, diferenciada de la mera corrección factual.
Evidencia requerida
Respuesta, intención del usuario, definición de la tarea y criterios de evaluación aplicables.
Unidad de observación
Respuesta o afirmación respecto de una tarea.
Unidad de análisis
Relación respuesta-tarea.
Método de codificación
Evaluar si la respuesta aborda realmente el constructo que se pretende medir.
Valores permitidos
Todavía no fijados.
Reglas de inclusión
La validez requiere una tarea o constructo previamente definido.
Reglas de exclusión
La validez no debe equipararse con:
exactitud factual;
recomendación;
autoridad de la fuente.
N/A
Cuando el constructo no pueda evaluarse a partir de la evidencia disponible.
Incertidumbre
Las interpretaciones inciertas del constructo DEBEN registrarse.
Evaluación externa requerida
Sí.
Ground truth
Especificación de la tarea y definición del constructo.
Criterio de validación
Evaluación independiente y validación del constructo.
Riesgos de medición
ambigüedad del constructo;
sesgo del evaluador;
confusión con exactitud;
dependencia de la tarea.
Prueba de reproducibilidad
Evaluación independiente utilizando definiciones idénticas de la tarea.
Limitaciones
La validez depende inherentemente del constructo que se pretende medir.
Estado
Variable de evaluación; derivación de métrica aplazada.
15. Variables entre modelos
15.1 Cobertura de motores
ID de variable
OV-CMP-01
Nombre
Cobertura de Motores
Definición operacional
Presencia de un fenómeno observable definido dentro del conjunto de sistemas de IA incluidos en un estudio de medición.
Fenómeno representado
Distribución de la visibilidad entre sistemas de IA.
Evidencia requerida
Observaciones comparables procedentes de cada sistema incluido.
Unidad de observación
Respuesta de un sistema de IA.
Unidad de análisis
Entidad objetivo dentro del conjunto de modelos definido.
Método de codificación
Primero se establece la observación relevante para cada sistema. La cobertura se deriva posteriormente de dichas observaciones.
Valores permitidos
Las observaciones subyacentes DEBEN conservarse.
La escala normalizada final no se fija en Framework 0.1.
Reglas de inclusión
Solo pueden contribuir los sistemas de IA incluidos previamente en el diseño experimental.
Reglas de exclusión
Las observaciones no disponibles no deben tratarse como observaciones negativas.
N/A
Cuando el universo de modelos no esté definido o existan observaciones insuficientes.
Incertidumbre
Las observaciones ausentes DEBEN mantenerse diferenciadas de las observaciones negativas.
Evaluación externa requerida
No en el nivel de observación.
Ground truth
Universo de modelos previamente definido.
Criterio de validación
Protocolo reproducible de inclusión de modelos y observación.
Riesgos de medición
disponibilidad del modelo;
diferencias de versión;
observaciones ausentes;
condiciones de respuesta desiguales.
Prueba de reproducibilidad
Replicación independiente utilizando el mismo universo de modelos.
Limitaciones
La cobertura es una variable derivada y depende de la calidad de las observaciones subyacentes.
Estado
Candidata a métrica derivada.
15.2 Frecuencia
ID de variable
OV-CMP-02
Nombre
Frecuencia de Recomendación / Visibilidad
Definición operacional
Recurrencia de un fenómeno observable definido a través de observaciones repetidas realizadas bajo un protocolo experimental previamente establecido.
Fenómeno representado
Reaparición del fenómeno frente a una presencia aislada.
Evidencia requerida
Múltiples observaciones registradas independientemente bajo condiciones comparables.
Unidad de observación
Ensayo experimental.
Unidad de análisis
Fenómeno objetivo a través de los ensayos.
Método de codificación
Cada ensayo se codifica independientemente. La frecuencia se deriva posteriormente de las observaciones obtenidas.
Valores permitidos
Los recuentos brutos de ocurrencias DEBERÍAN conservarse.
La normalización final y el denominador permanecen provisionales.
Reglas de inclusión
Los ensayos deben cumplir el protocolo experimental definido.
Reglas de exclusión
No deben combinarse observaciones generadas bajo condiciones materialmente diferentes sin registrar dichas diferencias.
N/A
Cuando el experimento contenga un número insuficiente de observaciones válidas.
Incertidumbre
La incertidumbre muestral DEBE conservarse.
Evaluación externa requerida
No necesariamente.
Ground truth
Protocolo experimental.
Criterio de validación
Replicación bajo el mismo protocolo.
Riesgos de medición
tamaño de muestra;
variación de prompts;
comportamiento estocástico;
efectos temporales;
elección del denominador.
Prueba de reproducibilidad
Muestreo repetido e independiente.
Limitaciones
La frecuencia es una propiedad tanto del comportamiento observado como del protocolo mediante el cual se mide.
Estado
Candidata a métrica derivada; denominador y protocolo de muestreo aún no resueltos.
16. Variables comparativas
16.1 Acuerdo
ID de variable
OV-CMP-03
Nombre
Acuerdo entre Modelos
Definición operacional
Grado en que diferentes sistemas de IA evaluados independientemente producen clasificaciones equivalentes para un mismo fenómeno definido bajo condiciones experimentales comparables.
Fenómeno representado
Convergencia entre sistemas de IA.
Evidencia requerida
Observaciones codificadas comparables procedentes de múltiples sistemas.
Unidad de observación
Resultado codificado a nivel de modelo.
Unidad de análisis
Fenómeno a través de modelos.
Método de codificación
El acuerdo DEBE evaluarse separadamente por dimensión.
Valores permitidos
No se fija una escala universal de acuerdo en Framework 0.1.
Reglas de inclusión
Solo pueden utilizarse observaciones comparables.
Reglas de exclusión
La similitud textual superficial no debe considerarse automáticamente acuerdo.
N/A
Cuando no existan suficientes observaciones comparables.
Incertidumbre
Las diferencias atribuibles a incertidumbre de anotación DEBEN distinguirse, cuando sea posible, de las divergencias reales entre modelos.
Evaluación externa requerida
Potencialmente, para validar la base de codificación.
Ground truth
El protocolo de codificación compartido, no un modelo individual.
Criterio de validación
El acuerdo debe ser reproducible en análisis independientes.
Riesgos de medición
diferencias de constructo;
efectos del prompt;
diferencias entre modelos;
desacuerdo de anotación.
Prueba de reproducibilidad
Codificación independiente entre modelos.
Limitaciones
El acuerdo no implica corrección.
Estado
Variable comparativa; derivación de métrica aplazada.
16.2 Divergencia
ID de variable
OV-CMP-04
Nombre
Divergencia entre Modelos
Definición operacional
Grado en que diferentes sistemas de IA producen clasificaciones o representaciones materialmente diferentes para un mismo fenómeno definido bajo condiciones comparables.
Fenómeno representado
Desacuerdo entre modelos.
Evidencia requerida
Observaciones comparables entre sistemas.
Unidad de observación
Resultado a nivel de modelo.
Unidad de análisis
Fenómeno entre modelos.
Método de codificación
La divergencia se deriva de observaciones codificadas comparables y DEBE interpretarse dimensión por dimensión.
Valores permitidos
No se fija una escala universal de divergencia en Framework 0.1.
Reglas de inclusión
Solo pueden compararse observaciones suficientemente equivalentes.
Reglas de exclusión
No debe interpretarse cualquier diferencia textual como divergencia metodológica.
N/A
Cuando la comparación no sea posible.
Incertidumbre
El posible desacuerdo de anotación DEBE registrarse por separado.
Evaluación externa requerida
No necesariamente.
Ground truth
Protocolo de medición compartido.
Criterio de validación
Comparación reproducible entre modelos.
Riesgos de medición
sensibilidad al prompt;
versión del modelo;
estocasticidad;
diferencias de anotación.
Prueba de reproducibilidad
Replicación independiente de la comparación entre modelos.
Limitaciones
La divergencia es descriptiva. No establece qué modelo es correcto.
Estado
Variable comparativa; derivación de métrica aplazada.
17. Variables deliberadamente excluidas de Metrics Framework 0.1
La Architecture Review identificó varios constructos para los que la evidencia o la definición operacional todavía no presentan suficiente madurez.
Por tanto, no se convierten en métricas en esta versión.
Entre ellos:
Volatilidad;
Persistencia;
Absorción;
Influencia;
otros constructos temporales que requieran evidencia longitudinal.
Estas variables permanecen dentro de la arquitectura de investigación de AVM™, pero no son métricas operativas en Framework 0.1.
La distinción es deliberada.
No medir todavía no significa que una variable no sea relevante.
Significa que la metodología actual todavía no proporciona evidencia suficiente para medirla de forma reproducible.
17. Reglas transversales de medición
18.1 ¿Qué cuenta como respuesta?
Una respuesta es la salida completa generada por la IA asociada a un ensayo experimental definido.
El registro original DEBERÍA conservarse sin modificaciones sustanciales.
Pueden realizarse transformaciones de formato para el análisis, pero la respuesta original DEBE permanecer disponible para auditoría.
19. ¿Qué cuenta como mención?
Una mención requiere una referencia textual identificable a la entidad objetivo.
La mención NO DEBE inferirse únicamente a partir de similitud semántica.
Los alias y abreviaturas pueden considerarse menciones cuando puedan mapearse inequívocamente a la entidad objetivo.
20. ¿Qué cuenta como recomendación?
La recomendación requiere una relación entre:
entidad + intención del usuario + afirmación de preferencia o selección
Por tanto:
Mención ≠ Recomendación
y:
Descripción ≠ Recomendación
Una comparación neutral NO DEBE considerarse automáticamente una recomendación.
21. Identificación de entidades
La identificación de la entidad DEBE realizarse antes de medir las variables relacionadas con la entidad.
El proceso de anotación DEBERÍA establecer:
entidad objetivo;
alias conocidos;
criterios de desambiguación;
aparición de la entidad;
confianza en la identificación.
Esto evita que las métricas posteriores se contaminen por una identificación incorrecta.
22. Presencia frente a prioridad
AVM™ DEBE distinguir entre:
Presencia
y:
Prioridad
Una entidad puede estar presente sin ser recomendada.
Una entidad puede ser recomendada sin ser la recomendación principal.
Una entidad puede ocupar la primera posición de una lista sin que la respuesta establezca explícitamente que dicha posición representa preferencia.
Por tanto, la posición NO DEBE interpretarse automáticamente como prioridad.
23. Listas y rankings
Las listas DEBEN clasificarse según si su orden tiene significado semántico.
Pueden constituir orden explícito:
recomendaciones numeradas;
listas clasificadas;
“mejor”, “segunda mejor”, etc.;
alternativas explícitamente ordenadas.
NO deben considerarse automáticamente rankings:
secuencia de párrafos;
orden de las citas;
orden alfabético;
orden arbitrario de viñetas.
24. Codificación de posición
La posición DEBERÍA registrarse únicamente cuando el orden sea explícito.
Cuando no exista un orden defendible:
Posición = N/A
La metodología NO DEBE estimar la posición a partir de intuiciones visuales o textuales.
Esto protege la distinción entre:
orden observado
y:
prominencia inferida.
25. Respuestas ambiguas
Las observaciones ambiguas NO DEBEN convertirse automáticamente en clasificaciones positivas o negativas.
El framework establece como mínimo la distinción entre:
observable;
no observable;
ambiguo;
N/A.
Las observaciones ambiguas DEBERÍAN conservarse para su posterior adjudicación.
26. Respuestas contradictorias
Si una misma respuesta contiene afirmaciones contradictorias sobre la misma entidad objetivo, la contradicción DEBE conservarse en el registro de evidencia.
El evaluador NO DEBERÍA seleccionar silenciosamente la interpretación que produzca el valor de métrica preferido.
Cuando sea necesario, la respuesta PUEDE generar múltiples observaciones a nivel de afirmación.
27. Ausencia
La ausencia no equivale a dato faltante.
El framework distingue entre:
Ausencia observada
No existe una observación válida
y:
N/A
Por ejemplo:
entidad no mencionada → ausencia observable;
respuesta no disponible → observación faltante;
estado de la entidad no determinable → N/A.
Estos estados NO DEBEN combinarse.
28. Tratamiento de N/A
N/A significa:
La variable no puede evaluarse válidamente bajo las condiciones de observación aplicables.
N/A NO DEBE convertirse automáticamente en cero.
La razón del N/A DEBERÍA registrarse siempre que sea posible.
29. Incertidumbre
La incertidumbre DEBERÍA representarse explícitamente cuando la evidencia no permita una clasificación determinista.
El framework distingue entre:
incertidumbre de medición;
incertidumbre de anotación;
incertidumbre de fuente;
incertidumbre del ground truth;
incertidumbre experimental.
El tratamiento de la incertidumbre DEBE definirse antes de introducir cualquier puntuación compuesta.
30. Evaluación externa
Algunas variables pueden establecerse directamente a partir de la respuesta.
Otras requieren una referencia externa.
El framework distingue, por tanto, entre:
Observación directa
Ejemplos:
presencia de entidad;
mención;
presencia de fuente;
posición explícita.
Evaluación externa
Ejemplos:
autoridad de la fuente;
exactitud;
fidelidad;
validez.
Las variables del segundo grupo NO DEBEN tratarse como si fueran directamente observables en la respuesta de IA.
31. Ground truth
El ground truth es necesario cuando una variable afirma correspondencia con una realidad externa o con un estado de referencia.
Ejemplo:
Afirmación de IA
↓
Evidencia de referencia
↓
Evaluación
El ground truth DEBE estar documentado suficientemente para permitir su auditoría.
Cuando no exista un ground truth defendible, el resultado apropiado PUEDE ser:
N/A
en lugar de una evaluación sin fundamento.
32. Protocolo de anotación
La implementación definitiva de AVM™ Metrics Framework 0.1 DEBERÍA utilizar un protocolo de anotación estandarizado.
Como mínimo, el protocolo DEBERÍA especificar:
qué recibe el anotador;
qué información permanece oculta;
qué constituye evidencia;
qué valores están permitidos;
cómo se gestionan los casos ambiguos;
cuándo puede utilizarse N/A;
cuándo se realiza adjudicación;
cómo se registran los desacuerdos.
Los anotadores NO DEBERÍAN inferir información que no esté disponible en el registro de observación definido.
33. Requisito de reproducibilidad
Una medición es reproducible únicamente cuando otro investigador cualificado puede aplicar el mismo protocolo a la misma evidencia y obtener un resultado materialmente equivalente.
Por tanto:
La reproducibilidad forma parte de la propia definición de la medición.
No es un procedimiento opcional de control de calidad que se añade posteriormente.
34. Prueba de reproducibilidad
El protocolo de validación de Framework 0.1 DEBERÍA incluir al menos:
Test A — Anotación independiente
Dos o más anotadores codifican independientemente observaciones idénticas.
Test B — Anotación ciega
Los anotadores no conocen las decisiones de los demás.
Test C — Adjudicación
Los desacuerdos se registran y resuelven mediante reglas previamente definidas.
Test D — Replicación
Un investigador independiente repite el procedimiento utilizando la misma especificación.
Test E — Sensibilidad de las reglas
Los casos límite se utilizan para identificar variables cuya clasificación depende excesivamente de interpretaciones subjetivas.
El objetivo no es forzar artificialmente el acuerdo.
El objetivo es descubrir dónde la metodología todavía está insuficientemente especificada.
35. Auditabilidad
Toda medición derivada DEBERÍA poder rastrearse mediante la siguiente cadena:
Métrica
↓
Observación(es) subyacente(s)
↓
Variable(s) codificada(s)
↓
Evidencia
↓
Respuesta original
↓
Contexto experimental
Una medición que no pueda rastrearse hacia atrás mediante esta cadena está metodológicamente incompleta.
36. Metadatos del modelo y del experimento
Toda observación experimental DEBERÍA registrar, cuando esté disponible:
proveedor de IA;
modelo;
versión del modelo;
interfaz/API;
fecha;
hora;
prompt;
condiciones del sistema;
temperatura u otro parámetro de generación equivalente, cuando esté disponible;
idioma;
configuración regional;
estado relevante de herramientas/búsqueda;
respuesta.
Esto es necesario porque las respuestas generadas por IA pueden variar según las condiciones experimentales.
37. No determinismo
Los sistemas de IA pueden generar respuestas diferentes ante el mismo prompt.
Por tanto:
Una respuesta es una observación, no necesariamente el fenómeno en sí mismo.
Pueden ser necesarias observaciones repetidas cuando la pregunta de investigación se refiere a recurrencia, estabilidad o frecuencia.
Las decisiones de muestreo DEBEN documentarse antes de calcular métricas derivadas.
38. Disciplina del denominador
No debe introducirse un denominador simplemente porque resulte conveniente expresar un resultado como porcentaje.
Antes de definir una tasa o métrica normalizada, AVM™ DEBE especificar:
numerador;
denominador;
criterios de elegibilidad;
tratamiento de observaciones faltantes;
tratamiento de N/A;
unidad de muestreo;
supuestos sobre independencia de las observaciones.
Este requisito es especialmente importante para Frecuencia y Cobertura de Motores.
39. Comparabilidad entre modelos
Las comparaciones entre sistemas de IA DEBERÍAN realizarse únicamente cuando las observaciones subyacentes sean suficientemente comparables.
El experimento DEBERÍA controlar, cuando sea posible:
prompts equivalentes;
intención de usuario equivalente;
condiciones de modelo comparables;
entidades objetivo equivalentes;
ventanas temporales equivalentes;
reglas de anotación equivalentes.
Las diferencias en las condiciones experimentales NO DEBEN interpretarse automáticamente como diferencias entre modelos.
40. Lo que Framework 0.1 no define
Este documento deliberadamente NO define:
AVM™ Score;
ponderaciones;
índices compuestos;
normalización definitiva;
escalas universales 0–100;
puntuaciones de impacto empresarial;
atribución de ingresos;
influencia causal;
ranking definitivo de modelos;
métricas definitivas de persistencia temporal.
Estos elementos requieren evidencia que todavía no está disponible.
41. Estado de investigación de las métricas
El framework produce actualmente tres clases metodológicas.
Clase A — Observables / Codificables
Variables que pueden establecerse directamente a partir de la respuesta mediante reglas definidas.
Ejemplos:
Identificación de Entidad;
Mención de Entidad;
Representación;
Recomendación;
Posición;
Presencia de Fuente.
Clase B — Evaluativas
Variables que requieren criterios externos o ground truth.
Ejemplos:
Autoridad de la Fuente;
Exactitud;
Fidelidad;
Validez.
Clase C — Derivadas / Comparativas
Variables que requieren múltiples observaciones.
Ejemplos:
Frecuencia;
Cobertura de Motores;
Acuerdo;
Divergencia.
Esta clasificación es importante porque las tres clases requieren procedimientos de validación diferentes.
42. Estado provisional de las métricas
En la versión 0.1, el framework no afirma que todas las métricas candidatas estén ya validadas.
Cada métrica recibe, en cambio, un estado metodológico:
PROVISIONAL
significa que existe una definición operacional pero requiere validación empírica.
VALIDACIÓN REQUERIDA
significa que el procedimiento de medición necesita un experimento específico de validación.
DERIVACIÓN APLAZADA
significa que las observaciones subyacentes están reconocidas, pero el tratamiento matemático definitivo se pospone deliberadamente.
CORE
significa que la variable pertenece actualmente a la arquitectura de medición propuesta.
43. Principio metodológico central
AVM™ Metrics Framework 0.1 adopta el siguiente principio:
Una métrica no se define por el número asignado a una observación. Se define por el procedimiento reproducible que transforma la evidencia en ese número.
Por tanto:
Evidencia
↓
Regla operacional
↓
Codificación
↓
Medición
debe especificarse antes de introducir:
Score
44. Falsabilidad experimental
El framework está diseñado deliberadamente para poder ser falsado.
Una prueba válida de AVM™ Metrics Framework 0.1 no consiste simplemente en comprobar si las mediciones resultantes parecen plausibles.
La prueba más exigente es:
¿Pueden investigadores independientes aplicar la especificación a la misma evidencia y obtener mediciones materialmente equivalentes?
Si no pueden, el framework habrá identificado una debilidad metodológica.
Esa debilidad DEBERÍA conducir a:
Observación
↓
Desacuerdo
↓
Análisis de la regla
↓
Revisión del framework
↓
Nueva validación
y no a un ajuste retrospectivo de los resultados.
45. Próximo experimento de validación
La siguiente fase experimental DEBERÍA diseñarse específicamente alrededor de la reproducibilidad.
El experimento DEBERÍA proporcionar:
conjunto fijo de prompts;
conjunto fijo de sistemas de IA;
conjunto fijo de entidades objetivo;
respuestas originales conservadas;
Metrics Framework 0.1;
anotadores independientes;
anotación ciega;
registro de desacuerdos;
adjudicación;
análisis de reproducibilidad.
El objetivo no es demostrar que AVM™ es correcto.
Es identificar dónde AVM™ 0.1 está insuficientemente especificado.
46. Criterios de aceptación de Framework 0.1
Antes de promocionar una variable a métrica validada, AVM™ DEBERÍA demostrar que:
su fenómeno puede identificarse;
la evidencia requerida está definida;
la regla de codificación es explícita;
los valores permitidos son conocidos;
existen reglas de inclusión y exclusión;
N/A está definido;
la incertidumbre puede registrarse;
los requisitos de evaluación externa están definidos;
los requisitos de ground truth están definidos cuando corresponda;
investigadores independientes pueden reproducir la clasificación;
los desacuerdos pueden diagnosticarse;
las limitaciones están documentadas.
Solo entonces la variable debería pasar a la derivación formal de la métrica.
47. Transición hacia AVM™ Metrics Framework 0.2
Los resultados del experimento de reproducibilidad DEBERÍAN producir la siguiente revisión.
Los resultados potenciales incluyen:
Framework 0.1
↓
Prueba de reproducibilidad
↓
│ Medición │ Medición │ Medición │
│ estable │ ambigua │ inválida │
↓ ↓ ↓
Mantener Redefinir Eliminar/
Aplazar
↓
Metrics Framework 0.2
Esto convierte el versionado en parte de la metodología y no únicamente en una convención editorial.
48. Conclusión final
AVM™ Metrics Framework 0.1 establece el puente operativo entre las variables observables de OVF 0.2 y el futuro sistema de medición de AVM™.
Su principal contribución no es un score.
Es una disciplina de medición.
El framework establece que:
Lo que produce la IA debe convertirse primero en un fenómeno observable.
Después:
El fenómeno debe codificarse mediante reglas explícitas.
Después:
La codificación debe ser reproducible.
Después:
La observación resultante puede transformarse en una métrica.
Y solo después:
Las métricas pueden compararse o, eventualmente, combinarse.
La cadena metodológica queda definida así:
RESPUESTA DE IA
│
▼
OBSERVACIÓN
│
▼
EVIDENCIA
│
▼
CODIFICACIÓN
│
▼
EVALUACIÓN
│
▼
MÉTRICA
│
▼
COMPARACIÓN
│
▼
VALIDACIÓN
│
▼
AVM™ SCORE
El framework se detiene deliberadamente antes de la última etapa.
No se introducen ponderaciones.
No se introduce un score compuesto.
No se define todavía AVM™ Score.
La siguiente tarea es empírica:
Intentar reproducir las mediciones y buscar deliberadamente situaciones en las que la especificación falle.
Si el framework supera esa prueba, las métricas resultantes no serán simplemente plausibles.
Habrán demostrado una propiedad metodológica mucho más importante:
Pueden ser medidas por alguien distinto de su autor, a partir de la misma evidencia, utilizando las mismas reglas y obteniendo un resultado documentado y explicable.
Ese es el umbral que AVM™ debe superar antes de que pueda considerarse metodológicamente defendible cualquier puntuación numérica de visibilidad.
Estado del documento
AVM™ Metrics Framework 0.1
Estado: Experimental / Provisional
Depende de: OVF 0.2 y AVM™ Metrics Architecture Review 0.1
Siguiente etapa: Experimento de Reproducibilidad y Falsación
Todavía no definido: AVM™ Score, ponderaciones, normalización y scoring de madurez
Principio metodológico:
Medir únicamente aquello que puede observarse, codificarse, reproducirse y auditarse.
Manu Duque
AI Visibility Specialist
ai-visibility.es





