Testing the Measurement Specification
Estado: Protocolo experimental
Versión: 0.1
Precedente: AVM™ Metrics Framework 0.1
Base empírica: Cross-Model Experiment P01–P20
Objetivo: Evaluar reproducibilidad, codificabilidad y falsabilidad de la especificación de medición AVM™
Resultado esperado: Evidencia para revisar AVM™ Metrics Framework 0.1
No incluye: AVM™ Score, ponderaciones ni scoring compuesto
1. Propósito
El AVM™ Reproducibility & Falsification Experiment 0.1 constituye la siguiente fase experimental del desarrollo de AVM™.
El experimento P01–P20 permitió observar diferencias entre sistemas de IA y descubrir fenómenos que posteriormente fueron formalizados como variables observables.
Ese experimento respondió principalmente a una pregunta:
¿Qué fenómenos aparecen en las respuestas de los sistemas de IA?
El presente experimento plantea una pregunta diferente:
¿Podemos medir esos fenómenos de forma reproducible?
Por tanto, el objeto de estudio ya no es principalmente el comportamiento de los modelos.
Es la especificación de medición de AVM™.
2. Cambio de objetivo experimental
La diferencia entre ambos experimentos puede representarse así:
EXPERIMENTO P01–P20
Respuesta de IA
│
▼
Observación
│
▼
Fenómeno
│
▼
Variable Observable
mientras que:
EXPERIMENTO DE REPRODUCIBILIDAD
Respuesta de IA
│
▼
Variable definida
│
▼
Reglas de codificación
│
▼
Anotador A
│
Anotador B ───► Comparación
│
Anotador C
│
▼
Reproducibilidad
La primera investigación descubre.
La segunda pone a prueba la capacidad de medir lo descubierto.
3. Pregunta principal de investigación
La pregunta principal es:
¿Puede un investigador independiente aplicar AVM™ Metrics Framework 0.1 a una respuesta de IA y obtener una clasificación materialmente equivalente a la obtenida por otro investigador que aplica las mismas reglas a la misma evidencia?
4. Preguntas secundarias
El experimento deberá responder además:
RQ1 — Observabilidad
¿Los investigadores identifican el mismo fenómeno observable?
RQ2 — Codificabilidad
¿Las reglas permiten convertir la observación en una categoría definida?
RQ3 — Reproducibilidad
¿Investigadores independientes producen resultados equivalentes?
RQ4 — Auditabilidad
¿Cada clasificación puede justificarse mediante evidencia recuperable?
RQ5 — Ambigüedad
¿Qué variables producen mayor número de casos ambiguos?
RQ6 — Robustez
¿Las reglas funcionan también en respuestas difíciles, contradictorias o incompletas?
RQ7 — Falsabilidad
¿Existen respuestas para las que el framework no pueda producir una clasificación defendible?
RQ8 — Adecuación
¿Algunas variables deberían modificarse, dividirse, fusionarse o eliminarse?
5. Hipótesis experimental
El experimento no parte de la hipótesis de que AVM™ Metrics Framework 0.1 sea correcto.
Parte de una hipótesis provisional mucho más limitada:
H1: Las variables centrales de AVM™ Metrics Framework 0.1 pueden codificarse mediante reglas suficientemente explícitas como para producir resultados reproducibles entre investigadores independientes.
Y una hipótesis de falsación:
H0: Al menos una parte de las variables del framework no puede ser codificada de forma suficientemente reproducible bajo las reglas actuales.
El objetivo no es demostrar H1.
El diseño debe permitir encontrar evidencia a favor de H0.
6. Principio de falsación
El experimento adopta deliberadamente una posición conservadora:
Si una variable requiere que el investigador interprete libremente lo que significa la respuesta, la especificación se considera insuficiente.
No se resolverán los desacuerdos mediante:
“Esto es lo que realmente quiso decir la IA.”
La pregunta será:
¿Las reglas escritas permiten llegar a esa conclusión sin depender del conocimiento del autor del framework?
Si la respuesta es no, existe un problema metodológico.
7. Evidencia experimental
El experimento utilizará como corpus inicial las respuestas obtenidas en el experimento P01–P20.
Esta decisión tiene una función de control.
No se pretende medir simultáneamente:
reproducibilidad de las respuestas de los modelos;
reproducibilidad de los investigadores.
En esta fase queremos aislar la segunda.
Por tanto:
La respuesta original constituye una unidad de evidencia fija.
8. Reutilización del corpus P01–P20
Cada respuesta deberá conservarse tal como fue registrada originalmente.
No deberá:
reescribirse;
corregirse;
resumirse;
normalizarse semánticamente;
modificarse para facilitar la anotación.
Podrán realizarse copias de trabajo, pero la evidencia original deberá permanecer intacta.
9. Unidad experimental
La unidad experimental primaria será:
Respuesta individual de IA asociada a un prompt concreto dentro del corpus P01–P20.
Una unidad puede representarse como:
Prompt
+
Sistema de IA
+
Modelo
+
Respuesta
+
Contexto experimental
Cuando exista información disponible sobre versión, fecha o configuración, deberá conservarse.
10. Variables sometidas a prueba
El experimento se centrará inicialmente en las variables que pueden evaluarse directamente sobre la respuesta.
Nivel 1 — Observación directa
OV-ENT-01 — Identificación de Entidad
OV-ENT-02 — Mención de Entidad
OV-REP-01 — Representación de Entidad
OV-REC-01 — Recomendación
OV-REC-02 — Posición de la Recomendación
OV-EVD-01 — Presencia de Fuente
Estas variables constituyen el Core Reproducibility Set 0.1.
11. Variables de evaluación externa
Una segunda fase podrá incorporar:
OV-EVD-02 — Autoridad de la Fuente
OV-EVL-01 — Exactitud
OV-EVL-02 — Fidelidad
OV-EVL-03 — Validez
Estas variables no deberán mezclarse inicialmente con las variables de observación directa porque introducen requisitos adicionales:
Respuesta
↓
Observación
↓
Fuente / Ground Truth
↓
Evaluación externa
Por tanto, se recomienda una validación secuencial.
12. Diseño experimental general
El experimento se divide en cuatro fases.
FASE I
Preparación del corpus
│
▼
FASE II
Anotación independiente
│
▼
FASE III
Análisis de reproducibilidad
│
▼
FASE IV
Falsación y revisión
13. FASE I — Preparación
Antes de comenzar la anotación deberán fijarse:
corpus;
variables;
versión del framework;
protocolo de anotación;
instrucciones para los anotadores;
valores permitidos;
reglas de inclusión;
reglas de exclusión;
tratamiento de N/A;
tratamiento de ambigüedad.
Una vez iniciada la anotación, estas reglas no deberían modificarse retrospectivamente para resolver un caso concreto.
14. Congelación de la especificación
Este punto es esencial.
Antes de comenzar la prueba deberá establecerse una:
Measurement Specification Freeze
Es decir:
AVM™ Metrics Framework 0.1 queda congelado para la primera ronda experimental.
No se modificarán las definiciones porque una respuesta concreta resulte difícil.
Si aparece un caso no contemplado:
Caso difícil
↓
Registro del problema
↓
Clasificación provisional / N/A
↓
Análisis posterior
No:
Caso difícil
↓
Modificar regla
↓
Volver a clasificar
15. FASE II — Anotación independiente
Cada respuesta será entregada a varios anotadores.
Como mínimo:
2 anotadores independientes
Idealmente:
3 anotadores independientes
Cada uno trabajará sin conocer las decisiones de los demás.
16. Condición de ceguera
Los anotadores no deberán conocer:
la clasificación de otros anotadores;
el resultado esperado;
la hipótesis concreta sobre una respuesta;
qué respuesta se considera especialmente relevante;
qué clasificación favorece o perjudica al framework.
El objetivo es reducir el efecto de expectativa.
17. Instrucciones del anotador
El anotador recibirá:
la definición de la variable;
las reglas;
la respuesta original;
el contexto mínimo necesario;
los valores permitidos;
el protocolo para N/A;
el protocolo para incertidumbre.
No recibirá interpretaciones adicionales fuera del protocolo.
Esto permite evaluar una cuestión crítica:
¿La especificación se explica por sí misma?
18. Registro de anotación
Cada decisión deberá generar un registro estructurado.
Ejemplo:
| Campo | Registro |
| Experiment ID | REP-001 |
| Prompt | P07 |
| Modelo | Modelo X |
| Variable | OV-REC-01 |
| Valor | Recomendada |
| Evidencia | Fragmento correspondiente |
| Confianza | Alta/Media/Baja |
| N/A | No |
| Incertidumbre | No |
| Justificación | Regla aplicada |
| Anotador | A01 |
La justificación no debe convertirse en un ensayo interpretativo.
Debe indicar:
qué regla se aplicó y qué evidencia la activó.
19. Evidencia mínima
Toda clasificación positiva deberá poder responder:
¿Dónde está la evidencia?
Por ello deberá conservarse:
fragmento;
posición;
referencia a la respuesta original.
La ausencia de evidencia identificable deberá considerarse un problema de auditabilidad.
20. Anotación de ambigüedad
Cuando el anotador no pueda determinar razonablemente el valor, no deberá elegir arbitrariamente.
Deberá utilizar:
Ambigua
cuando esta categoría esté permitida.
Y:
N/A
cuando la variable no pueda evaluarse válidamente.
Esta diferencia deberá conservarse.
21. Ambigüedad ≠ desacuerdo
El framework debe distinguir dos fenómenos.
Ambigüedad
El propio texto no permite determinar claramente el valor.
Desacuerdo
Dos investigadores interpretan de forma diferente una evidencia que ambos consideran evaluable.
Ejemplo:
Respuesta ambigua
↓
A → Ambigua
B → Ambigua
Resultado:
AMBIGÜEDAD COMPARTIDA
Frente a:
Respuesta clara
↓
A → Recomendada
B → No recomendada
Resultado:
DESACUERDO DE CODIFICACIÓN
Son problemas metodológicos diferentes.
22. FASE III — Análisis de reproducibilidad
Una vez finalizada la primera ronda, se compararán las anotaciones.
No se analizará únicamente:
“¿Coinciden?”
También:
“¿Por qué no coinciden?”
23. Matriz de acuerdo
Para cada variable se construirá una matriz:
| Variable | Casos | Acuerdos | Desacuerdos | Ambiguos | N/A |
| Identificación | — | — | — | — | — |
| Mención | — | — | — | — | — |
| Representación | — | — | — | — | — |
| Recomendación | — | — | — | — | — |
| Posición | — | — | — | — | — |
| Fuente | — | — | — | — | — |
Los valores se completarán únicamente después de realizar la anotación.
24. No se utilizará únicamente porcentaje de acuerdo
El porcentaje de acuerdo puede ser útil, pero no suficiente.
Dos anotadores pueden coincidir mucho simplemente porque la mayoría de las respuestas son negativas.
Por ello, el análisis deberá distinguir entre:
acuerdo bruto;
distribución de categorías;
desacuerdo por categoría;
frecuencia de N/A;
frecuencia de ambigüedad;
tipo de error;
resolución mediante adjudicación.
Los índices estadísticos de acuerdo podrán incorporarse posteriormente, pero no deben imponerse antes de comprender la estructura de los datos.
25. Taxonomía de desacuerdos
Cada desacuerdo deberá clasificarse.
Propongo inicialmente:
| Código | Tipo |
| F01 | Definición ambigua |
| F02 | Regla de inclusión insuficiente |
| F03 | Regla de exclusión insuficiente |
| F04 | Evidencia insuficiente |
| F05 | Entidad ambigua |
| F06 | Dependencia contextual |
| F07 | Interpretación subjetiva |
| F08 | N/A insuficientemente definido |
| F09 | Valores permitidos insuficientes |
| F10 | Regla contradictoria |
| F11 | Caso no contemplado |
| F12 | Constructo mal delimitado |
| F13 | Evidencia difícil de localizar |
| F14 | Confusión entre variables |
| F15 | Error del anotador |
Esta taxonomía podrá evolucionar como resultado del propio experimento.
26. F01 — Definición ambigua
Se utilizará cuando dos investigadores entiendan de forma diferente qué significa la variable.
Ejemplo conceptual:
¿Qué diferencia exactamente “representación sustantiva” de “mención”?
Si la respuesta no está suficientemente especificada, el problema pertenece a la definición.
27. F02 — Regla insuficiente
La variable está bien definida conceptualmente, pero las reglas no permiten resolver el caso.
Esto es especialmente importante porque significa:
El constructo puede ser válido, pero la operacionalización es insuficiente.
28. F07 — Interpretación subjetiva
Se registrará cuando la clasificación dependa principalmente de la intuición del anotador.
Este tipo de fallo será especialmente importante.
Una variable que sistemáticamente exige:
“yo interpreto que…”
podría no estar suficientemente operacionalizada.
29. F14 — Confusión entre variables
Esta categoría permitirá detectar precisamente uno de los problemas descubiertos durante P01–P20.
Ejemplos:
Mención → Recomendación
Posición → Prioridad
Fuente → Exactitud
Identificación → Comprensión
Si los anotadores confunden sistemáticamente dos variables, habrá que revisar su separación conceptual u operacional.
30. FASE IV — Adjudicación
Después de la primera ronda se realizará una sesión de adjudicación.
Su función NO será ocultar los desacuerdos.
Será:
diagnosticar por qué ocurrieron.
Para cada desacuerdo se conservarán:
decisión A;
decisión B;
evidencia;
regla aplicada por cada anotador;
causa del desacuerdo;
resolución;
posible modificación futura.
31. Resultado de adjudicación
Cada caso deberá terminar en uno de estos estados:
RESOLVED BY RULE
La regla existente era suficiente; el desacuerdo procedía de una aplicación incorrecta.
RESOLVED BY CLARIFICATION
La regla era válida pero necesitaba una aclaración.
RULE INSUFFICIENT
La regla no permitía resolver el caso.
CONCEPTUAL PROBLEM
El problema está en la propia definición de la variable.
UNRESOLVABLE
No existe evidencia suficiente para una clasificación defendible.
Esta última categoría es especialmente importante.
32. Prueba de auditabilidad
Una muestra de las decisiones deberá someterse a una segunda revisión.
Un investigador que no haya participado en la primera anotación recibirá:
respuesta;
clasificación;
evidencia;
regla utilizada.
Y deberá responder:
¿Puede reconstruirse la decisión?
El objetivo es comprobar que la medición no depende únicamente de la memoria del anotador original.
33. Prueba de robustez
El corpus P01–P20 deberá incluir deliberadamente casos de diferentes niveles de dificultad.
Casos claros
La variable aparece de manera explícita.
Casos implícitos
La interpretación requiere contexto.
Casos ambiguos
Existen varias interpretaciones plausibles.
Casos negativos
El fenómeno no aparece.
Casos contradictorios
La respuesta contiene señales incompatibles.
Casos frontera
La respuesta se encuentra cerca del límite de la definición.
Esto permite comprobar si las reglas funcionan fuera de los ejemplos fáciles.
34. Prueba de casos negativos
No basta con demostrar que una variable puede detectarse cuando está presente.
También debemos comprobar:
¿El framework evita detectar el fenómeno cuando no está presente?
Por ejemplo:
Mención ≠ Recomendación
debe probarse tanto con:
recomendaciones reales;
como con:
menciones puramente descriptivas.
35. Prueba específica de Recomendación
Dado que Recomendación constituye uno de los constructos centrales de AVM™, tendrá una prueba específica.
Se deberán distinguir al menos:
simple mención;
descripción positiva;
comparación;
sugerencia;
recomendación explícita;
recomendación condicional;
primera opción;
alternativa;
advertencia negativa.
La finalidad es evitar:
“sentimiento positivo” = “recomendación”.
36. Prueba específica de Posición
También deberá comprobarse:
Posición textual
≠
Posición ordinal explícita
≠
Prominencia
≠
Prioridad
Una entidad situada al principio de una respuesta no deberá clasificarse automáticamente como prioritaria.
37. Prueba específica de Fuente
La presencia de una fuente deberá separarse de:
autoridad;
exactitud;
relevancia;
fidelidad.
Por tanto:
Fuente presente
≠
Fuente autoritativa
≠
Afirmación correcta
El experimento deberá comprobar si los anotadores respetan esta separación.
38. Criterio de falsación de una variable
Una variable podrá considerarse provisionalmente falsada como métrica operativa si se observa alguno de los siguientes patrones:
desacuerdo elevado y sistemático;
múltiples interpretaciones razonables de la definición;
necesidad recurrente de información no incluida en el protocolo;
incapacidad de localizar evidencia;
dependencia excesiva del juicio subjetivo;
imposibilidad de distinguirla de otra variable;
N/A utilizado para una proporción sustancial de casos por problemas estructurales;
reglas contradictorias;
imposibilidad de replicar decisiones incluso después de aclarar las instrucciones.
“Falsada” aquí no significa:
“el fenómeno no existe”.
Significa:
la especificación actual no consigue medirlo adecuadamente.
39. Criterio de supervivencia
Una variable podrá avanzar provisionalmente cuando:
tenga definición operacional clara;
exista evidencia identificable;
las reglas permitan clasificar los casos;
los desacuerdos sean explicables;
los casos ambiguos puedan tratarse;
las decisiones sean auditables;
la reproducibilidad sea suficiente para el propósito experimental.
El umbral numérico definitivo se establecerá después de observar los datos, no antes de manera arbitraria.
40. No optimización retrospectiva
Está prohibido utilizar los resultados del experimento para modificar las reglas y posteriormente presentar la versión modificada como si hubiese sido la especificación probada.
El ciclo correcto será:
Framework 0.1 congelado
↓
Experimento
↓
Resultados
↓
Problemas identificados
↓
Framework 0.2
No:
Framework 0.1
↓
Experimento
↓
Modificar reglas
↓
Reclasificar
↓
Presentar como resultado de 0.1
41. Control de versiones
Cada resultado deberá asociarse a la versión exacta de la especificación utilizada.
Por ejemplo:
AVM™ Metrics Framework 0.1 — Measurement Specification Freeze A
Una futura modificación generará:
AVM™ Metrics Framework 0.2
Las mediciones anteriores deberán permanecer asociadas a 0.1.
42. Registro de cambios
Cada modificación posterior deberá registrar:
| Campo | Descripción |
| Variable | Variable afectada |
| Problema | Evidencia del fallo |
| Tipo | Código F01–F15 |
| Cambio | Modificación propuesta |
| Justificación | Motivo metodológico |
| Impacto | Qué mediciones afecta |
| Versión | Nueva versión |
Esto permite que el framework tenga una verdadera trazabilidad evolutiva.
43. Reproducibilidad entre investigadores
La reproducibilidad se evaluará en dos niveles.
Nivel A — Reproducibilidad de anotación
Misma respuesta + mismas reglas → misma clasificación.
Nivel B — Reproducibilidad del procedimiento
Mismo protocolo + corpus equivalente → procedimiento replicable por otro investigador.
La segunda es más exigente.
No basta con que dos personas lleguen al mismo resultado si nadie más puede reconstruir cómo llegaron a él.
44. Reproducibilidad entre modelos
Esta fase no pretende todavía demostrar reproducibilidad del comportamiento de los modelos.
Eso será una investigación posterior.
Aquí los modelos constituyen parte del corpus.
El objeto experimental es:
la medición humana de las respuestas.
Esta separación evita mezclar dos fuentes de variabilidad.
45. Tratamiento de la no determinación
El framework no obligará a producir un valor cuando la evidencia no lo permita.
Se utilizarán tres estados diferentes:
OBSERVABLE
NO OBSERVABLE
NO DETERMINABLE
y, cuando corresponda:
N/A
Esto protege contra la falsa precisión.
46. Falsa precisión
Una de las amenazas que este experimento pretende detectar es:
convertir incertidumbre cualitativa en números aparentemente precisos.
Ejemplo:
Si dos investigadores no pueden decidir si existe una recomendación, asignar:
Recomendación = 0.5
no resuelve el problema.
Simplemente lo oculta.
La solución correcta en Framework 0.1 es registrar:
Ambigua / N/A / desacuerdo
hasta que exista una regla suficientemente defendible.
47. Resultado primario
El resultado primario será:
Reproducibilidad de la codificación de las variables centrales.
No será:
AVM Score;
ranking de marcas;
ranking de modelos;
porcentaje de visibilidad;
benchmark comercial.
El experimento evalúa el instrumento de medición, no el objeto comercial medido.
48. Resultados secundarios
Se registrarán:
tasa de ambigüedad;
tasa de N/A;
tipos de desacuerdo;
variables más difíciles;
reglas insuficientes;
casos frontera;
errores de aplicación;
problemas de auditabilidad;
necesidad de ground truth;
variables potencialmente redundantes.
49. Output esperado
El experimento generará tres artefactos.
A. Dataset de anotación
Las respuestas P01–P20 con las codificaciones independientes.
B. AVM™ Reproducibility Results 0.1
Informe de resultados experimentales.
C. AVM™ Metrics Framework Change Log 0.1 → 0.2
Registro de todas las modificaciones justificadas por la evidencia.
50. Informe de resultados
El informe posterior deberá contener, como mínimo:
objetivo;
corpus;
variables;
anotadores;
protocolo;
resultados;
acuerdo;
desacuerdos;
ambigüedades;
N/A;
errores;
casos frontera;
análisis de falsación;
decisiones por variable;
modificaciones propuestas;
limitaciones;
conclusiones.
51. Tabla final de decisión
La salida principal por variable tendrá esta forma:
| Variable | Reproducibilidad | Problemas | Decisión |
| Identificación | Pendiente | — | — |
| Mención | Pendiente | — | — |
| Representación | Pendiente | — | — |
| Recomendación | Pendiente | — | — |
| Posición | Pendiente | — | — |
| Presencia de fuente | Pendiente | — | — |
Y las decisiones posibles serán:
MANTENER
REFINAR
DIVIDIR
FUSIONAR
APLAZAR
ELIMINAR
52. Regla de decisión
Una variable no debe mantenerse simplemente porque sea conceptualmente interesante.
La decisión deberá responder:
¿Podemos medirla de manera suficientemente reproducible con la especificación disponible?
Esto desplaza el criterio desde:
“¿Nos parece una buena variable?”
hacia:
“¿Podemos demostrar que es medible?”
53. Qué significaría que falle AVM™
El experimento debe aceptar explícitamente la posibilidad de que algunas distinciones descubiertas durante P01–P20 no puedan convertirse en variables reproducibles.
Por ejemplo:
Fenómeno observado
↓
Conceptualmente válido
↓
Pero operacionalmente ambiguo
↓
NO MÉTRICA
Esto no invalida el descubrimiento original.
Demuestra que:
observar un fenómeno y medirlo son problemas metodológicos diferentes.
54. Resultado posible de mayor valor
Uno de los resultados más valiosos sería descubrir que:
“Recomendación” necesita dividirse en varios subconstructos.
Por ejemplo:
Recomendación
├── Recomendación explícita
├── Recomendación condicional
├── Preferencia
└── Selección contextual
Pero esto no se debe decidir ahora.
Debe surgir únicamente si los datos experimentales muestran que la categoría actual produce desacuerdos sistemáticos.
55. Otro resultado posible
También podría ocurrir que:
Mención
+
Identificación
sean altamente reproducibles y puedan mantenerse como variables simples.
Mientras que:
Representación
produzca desacuerdos frecuentes.
En ese caso no deberíamos “forzar” Representación para que sobreviva.
Deberíamos preguntarnos:
¿La variable necesita una definición diferente o realmente estamos intentando medir un constructo demasiado complejo?
56. Relación con AVM™ Metrics Framework 0.1
El experimento no modifica directamente el framework.
Primero lo prueba.
La relación es:
METRICS FRAMEWORK 0.1
│
especifica
▼
EXPERIMENTO 0.1
│
produce evidencia
▼
VALIDATION RESULTS
│
justifican
▼
METRICS FRAMEWORK 0.2
Por tanto, el experimento es un instrumento de evaluación del framework.
57. Relación con AVM™ Score
AVM™ Score queda fuera del experimento.
No se calculará ningún score compuesto.
La razón es metodológica:
No tiene sentido combinar métricas cuya reproducibilidad todavía está siendo evaluada.
La secuencia debe mantenerse:
Variable
↓
Medición
↓
Reproducibilidad
↓
Validación
↓
Métrica estable
↓
Comparación
↓
Score
58. Principio de independencia
El experimento deberá ser suficientemente independiente del autor de AVM™.
Esto no significa necesariamente que el autor no participe.
Significa que:
el resultado no debe depender exclusivamente de que el creador del framework explique oralmente cómo interpretar cada caso.
Si una variable solo funciona cuando su creador explica personalmente su intención, todavía no existe una especificación suficientemente reproducible.
59. Criterio de éxito del protocolo
El experimento será metodológicamente exitoso incluso si concluye que:
una variable debe eliminarse;
una variable debe dividirse;
una definición era incorrecta;
una regla era insuficiente;
un constructo no puede medirse todavía.
El fracaso metodológico sería otro:
ocultar esos problemas para obtener una tasa de reproducibilidad aparentemente favorable.
Conclusión
El AVM™ Reproducibility & Falsification Experiment 0.1 cambia el centro de gravedad de la investigación.
P01–P20 preguntó:
¿Qué ocurre cuando diferentes sistemas de IA responden a las mismas preguntas?
OVF 0.1 y 0.2 transformaron esas observaciones en variables.
Metrics Architecture Review 0.1 preguntó:
¿Qué variables pueden formar parte de una arquitectura de medición?
Metrics Framework 0.1 respondió:
¿Cómo podríamos medirlas de forma operativa?
Ahora el nuevo experimento plantea la pregunta más incómoda:
¿Puede otra persona aplicar esas reglas y llegar a la misma medición?
La respuesta no debe darse por supuesta.
Debe demostrarse.
Cadena metodológica actualizada
El desarrollo de AVM™ queda ahora estructurado como:
AVM™
│
▼
CROSS-MODEL EXPERIMENT
P01–P20
│
▼
OVF 0.1
│
▼
OVF 0.2
│
▼
METRICS ARCHITECTURE REVIEW 0.1
│
▼
METRICS FRAMEWORK 0.1
│
SPECIFICATION FREEZE
│
▼
AVM™ REPRODUCIBILITY &
FALSIFICATION EXPERIMENT 0.1
Same evidence
Independent annotators
Explicit rules
Blind coding
Disagreement analysis
Auditability
▼
REPRODUCIBILITY RESULTS
│
▼
FALSIFICATION ANALYSIS
│
▼ ▼ ▼
MANTENER REFINAR ELIMINAR
▼
METRICS FRAMEWORK 0.2
│
▼
VALIDATION PHASE
│
▼
AVM™ METRICS
│
▼
AVM™ SCORE
│
▼
AVMM™
Principio que queda establecido
AVM™ no debe preguntar primero cuánto vale una marca. Debe demostrar primero que dos investigadores pueden observar, codificar y medir el mismo fenómeno de la misma manera.
Manu Duque
AI Visibility Specialist
ai-visibility.es





