AVM™ Experimental Annotation Matrix 0.1

 

Annotation Dataset Specification

Documento: AVM™ Experimental Annotation Matrix
Versión: 0.1
Estado: Especificación operativa experimental
Experimento: AVM™ Reproducibility & Falsification Experiment 0.1
Corpus base: Cross-Model Experiment P01–P20
Primera prueba: P01 × Recognition × Category
AVM™ Score: Fuera de alcance

 

1. Propósito

La AVM™ Experimental Annotation Matrix 0.1 es el instrumento mediante el cual las respuestas originales del experimento Cross-Model P01–P20 serán transformadas en observaciones codificadas y auditables.

No es una matriz de resultados.

Es una matriz de anotación.

Su función es establecer una separación estricta entre:

evidencia original

y

decisión del investigador.

La matriz permitirá posteriormente comparar las decisiones de investigadores independientes sobre exactamente la misma evidencia.

 

2. Principio fundamental

La matriz adopta el principio:

No se registra únicamente qué se decidió. Se registra qué evidencia permitió tomar esa decisión y qué regla fue aplicada.

Por tanto:

Respuesta original

Evidencia identificable

Regla de codificación

Valor codificado

Anotador

Reproducibilidad

 

3. Estado del corpus

El corpus verificable actualmente queda:

Sistema Prompts disponibles Unidades
Gemini P01–P20 20
Claude P01–P20 20
Perplexity P01–P11 11
ChatGPT P01–P20 pendiente de incorporación
Disponible ahora 51

Importante: el cálculo anterior de 60 no es correcto si se cuenta Perplexity como 11: 20 + 20 + 11 = 51. El documento se corrige aquí para mantener trazabilidad.

Por tanto, el corpus verificable en los archivos recuperados es:

51 respuestas originales.

No se completarán artificialmente las 9 de Perplexity ni las 20 de ChatGPT.

 

4. Identificación de unidades

Cada respuesta recibirá un identificador experimental permanente.

Formato:

AVM-REP-[MODEL]-[PROMPT]

Ejemplos:

AVM-REP-GEM-P01

AVM-REP-CLA-P01

AVM-REP-PER-P01

AVM-REP-GPT-P01

Cuando ChatGPT sea incorporado, se añadirán sus unidades sin modificar las existentes.

 

5. Estructura de la matriz

Cada registro de anotación tendrá como mínimo:

Campo Descripción
Experiment ID Identificador único
Model Sistema de IA
Prompt ID P01–P20
Variable ID Variable sometida a prueba
Evidence Evidencia observable
Evidence Location Localización
Coded Value Valor asignado
Rule ID Regla aplicada
Uncertainty Incertidumbre
N/A Aplicabilidad
Annotator ID Investigador
Timestamp Momento de anotación
Notes Observaciones metodológicas

 

 

6. Separación de capas

La matriz tendrá tres capas.

Capa A — Corpus

Lo que realmente respondió el sistema.

Capa B — Evidencia

El fragmento concreto que activa una observación.

Capa C — Codificación

La interpretación realizada siguiendo el Framework.

Esto evita que:

interpretación → se convierta retroactivamente en evidencia.

 

7. Variables iniciales

La primera prueba utilizará:

CORE-A — Recognition

R01 — Recognition

¿El sistema identifica AVM™ como el concepto objetivo del experimento?

CORE-B — Category

C01 — Category Recognition

¿El sistema sitúa AVM™ en la categoría conceptual correspondiente a AI Visibility / AI Visibility Model?

La separación es deliberada.

El experimento P01 ya demuestra por qué no debemos fusionarlas.

 

8. Definición experimental de Recognition

Para esta primera ronda:

Recognition representa la identificación de AVM™ como una entidad o concepto distinguible dentro de la respuesta.

No implica:

comprensión correcta;

atribución correcta;

autoridad;

recomendación;

exactitud.

Por tanto:

Recognition

Understanding

Attribution

Recommendation

Esto conserva una de las distinciones centrales descubiertas en OVF.

 

9. Definición experimental de Category

Category Recognition representa la clasificación conceptual de AVM™.

La pregunta no es:

“¿Menciona AVM?”

sino:

“¿Qué cree que es AVM™?”

Una respuesta puede, por tanto:

RECOGNIZE = YES

CATEGORY = WRONG

Esto constituye un caso experimental válido.

 

10. Valores permitidos

Para la primera ronda:

Recognition

R0 — No identificado

R1 — Identificado

RA — Ambiguo

RN — No determinable

Category

C0 — No clasificado

C1 — AI Visibility / AI Visibility Model

C2 — Otra categoría

CA — Ambiguo

CN — No determinable

No se utilizarán valores intermedios inventados durante la anotación.

 

11. Regla de independencia

El anotador no puede utilizar P02 para resolver P01.

Esto es especialmente importante.

P01 debe evaluarse como:

una respuesta aislada.

No podemos permitir:

P01 → no estoy seguro

miro P02

ahora sé que AVM significa AI Visibility

Eso introduciría información externa a la unidad experimental.

 

12. P01 como prueba de estrés

P01 es especialmente adecuado para la primera prueba porque los sistemas producen respuestas diferentes.

Por ejemplo, Gemini comienza presentando AVM como varios conceptos:

AVM GmbH / FRITZ!;

Automated Valuation Model;

malformación arteriovenosa.

Claude, en cambio, incluye explícitamente:

“AI Visibility Model (AVM™)”

como primer significado dentro de su desambiguación.

Perplexity interpreta inicialmente AVM™ como:

“Adjusted Valuation Model™” de Admetricks, aunque posteriormente incluye AI Visibility Model entre otros significados.

Esto convierte P01 en un caso ideal para comprobar si las reglas realmente distinguen:

reconocer el término

de

reconocer correctamente la entidad objetivo.

 

13. MATRIZ EXPERIMENTAL — P01

Primera ronda: Recognition → Category

Unidad 01 — Gemini

ID: AVM-REP-GEM-P01

Prompt:

P01 — ¿Qué es AVM™?

Evidencia principal:

Gemini comienza:

“Las siglas AVM pueden referirse a varios conceptos diferentes según el contexto…”

Después identifica:

AVM GmbH / FRITZ!;

Automated Valuation Model;

Malformación Arteriovenosa.

No aparece en esta respuesta inicial la identificación explícita de AI Visibility Model dentro del fragmento P01 recuperado.

 

Registro de anotación

Campo Valor
Experiment ID AVM-REP-GEM-P01
Variable R01 Recognition
Evidence Ambiguous candidate set / multiple AVM meanings
Coded Value — Annotator A pendiente
Coded Value — Annotator B pendiente
Coded Value — Annotator C pendiente
Category pendiente
Rule pendiente
Uncertainty pendiente
Adjudication pendiente

No asignamos todavía el resultado.

 

14. Unidad 02 — Claude

ID: AVM-REP-CLA-P01

Prompt:

P01 — ¿Qué es AVM™?

Claude indica explícitamente que AVM™ es ambiguo y enumera diferentes significados.

El primero es:

AI Visibility Model (AVM™)

y lo describe como un modelo para estudiar y medir la visibilidad IA.

 

Registro

Campo Valor
Experiment ID AVM-REP-CLA-P01
Variable R01 Recognition
Evidence AI Visibility Model (AVM™) explícitamente identificado
Coded Value — Annotator A pendiente
Coded Value — Annotator B pendiente
Coded Value — Annotator C pendiente
Category pendiente
Rule pendiente
Uncertainty pendiente
Adjudication pendiente

 

15. Unidad 03 — Perplexity

ID: AVM-REP-PER-P01

Perplexity afirma:

“AVM™ (con la marca registrada) se refiere específicamente al Adjusted Valuation Model™ de la plataforma Admetricks…”

Posteriormente incluye:

AI Visibility Model

entre otros significados de AVM.

 

Registro

Campo Valor
Experiment ID AVM-REP-PER-P01
Variable R01 Recognition
Evidence AVM™ atribuido inicialmente a Admetricks; AI Visibility Model aparece posteriormente
Coded Value — Annotator A pendiente
Coded Value — Annotator B pendiente
Coded Value — Annotator C pendiente
Category pendiente
Rule pendiente
Uncertainty pendiente
Adjudication pendiente

Este caso es particularmente importante porque introduce orden de identificación como posible factor metodológico.

 

16. Unidad 04 — ChatGPT

ID previsto:

AVM-REP-GPT-P01

Estado

PENDIENTE DE INCORPORACIÓN DEL ARCHIVO DE CHATGPT

No se rellenará con memoria ni con inferencia.

 

17. Primera matriz comparativa

La matriz de P01 queda por tanto:

Sistema Recognition Category Evidencia
Gemini Múltiples significados; no aparece explícitamente AI Visibility Model en el fragmento P01 recuperado
Claude AI Visibility Model identificado explícitamente
Perplexity Admetricks inicialmente; AI Visibility Model posteriormente
ChatGPT Pendiente de corpus

 

Los símbolos ☐ no significan “No”.

Significan:

todavía no anotado.

Esto es crucial para no contaminar el dataset.

 

18. El primer experimento todavía NO tiene resultado

Aunque nosotros podamos intuitivamente anticipar determinadas clasificaciones, no debemos introducirlas en la matriz de resultados.

Ahora empieza el verdadero experimento.

La matriz debe permanecer:

EVIDENCIA

[ ANOTADOR A ] [ ANOTADOR B ] [ ANOTADOR C ]

COMPARACIÓN

ADJUDICACIÓN

No:

Evidencia

ChatGPT decide

Resultado

 

19. Hoja de anotación individual

Cada investigador recibirá una versión como esta:

 

AVM-REP-GEM-P01

Variable R01 — Recognition

Pregunta:

¿La respuesta identifica AVM™ como la entidad objetivo AI Visibility Model?

Valores:

R0 No identificado

R1 Identificado

RA Ambiguo

RN No determinable

Evidencia:

Localización:

Regla aplicada:

Nivel de incertidumbre:

Bajo

Medio

Alto

Decisión:

Variable C01 — Category

Pregunta:

¿La respuesta clasifica AVM™ como AI Visibility / AI Visibility Model?

Valores:

C0 No clasificado

C1 AI Visibility / AI Visibility Model

C2 Otra categoría

CA Ambiguo

CN No determinable

Evidencia:

Localización:

Regla aplicada:

Decisión:

 

20. Regla especial: orden

P01 nos obliga a introducir una variable auxiliar que todavía no es una métrica:

EVIDENCE_ORDER

1 — Primera identificación

2 — Identificación posterior

3 — Identificación incidental

4 — No identificada

¿Por qué?

Porque Perplexity presenta un caso que no podemos ignorar:

AVM™

Adjusted Valuation Model

otros significados

AI Visibility Model

Mientras Claude presenta:

AVM™

AI Visibility Model

La pregunta experimental será:

¿Recognition depende solamente de la presencia del concepto o también del orden en que aparece?

No lo decidimos todavía.

Lo investigamos.

 

21. Esta es precisamente la clase de problema que buscábamos

La Architecture Review decía:

todavía no sabemos qué constituye reconocimiento.

Ahora P01 nos ofrece un caso real para poner esa cuestión a prueba.

Tenemos al menos tres situaciones:

CASO A

Identificación directa

 

CASO B

Identificación después de desambiguación

 

CASO C

Identificación posterior a una atribución inicial diferente

Si dos anotadores clasifican estos casos de forma diferente, no corregiremos el dato.

Registraremos el desacuerdo.

 

22. Taxonomía de fallo aplicada a P01

Para esta primera prueba ya podemos activar:

Código Posible problema
F01 Definición de Recognition insuficiente
F02 Regla de inclusión insuficiente
F03 Regla de exclusión insuficiente
F05 Ambigüedad de entidad
F06 Dependencia del contexto
F07 Interpretación subjetiva
F11 Caso no contemplado
F14 Confusión Recognition / Category

Pero no asignaremos ninguno hasta que aparezca un desacuerdo real.

 

23. Qué NO vamos a hacer

No vamos a decir:

“Claude reconoce AVM y Perplexity también, pero Gemini no.”

Eso sería ya una conclusión analítica.

Primero necesitamos saber:

¿Dos investigadores independientes codifican esos tres casos de la misma forma?

Ese es el experimento.

 

24. Registro de reproducibilidad

Después de la primera anotación:

Unidad A B C Acuerdo Tipo de discrepancia
GEM-P01 / Recognition
GEM-P01 / Category
CLA-P01 / Recognition
CLA-P01 / Category
PER-P01 / Recognition
PER-P01 / Category

 

 

25. Extensión al corpus completo

Una vez validada esta primera unidad experimental, la matriz se extenderá a:

51 respuestas actualmente verificadas

×

Recognition

×

Category

y posteriormente:

51

×

Recognition

Category

Attribution

Methodology

Mention

Representation

Recommendation

Position

Citation

Source

Accuracy

Cuando recuperemos las 20 respuestas de ChatGPT, el corpus podrá llegar a las 71 unidades originales previstas, manteniendo exactamente los mismos IDs y reglas.

 

26. Criterio de parada de esta primera fase

No avanzaremos de:

Recognition → Category

a:

Recommendation

hasta saber si las dos primeras variables son realmente codificables.

Esto introduce un principio de progresión por validación:

Recognition

¿Reproducible?

YES

Category

¿Reproducible?

YES

Siguiente constructo

Si Recognition falla:

Recognition

FAIL

Revisión

Framework 0.2

 

27. Primer hallazgo que ya podemos registrar

Sin convertirlo todavía en resultado de reproducibilidad, el corpus demuestra que P01 contiene variación suficiente para constituir un buen caso de prueba.

Claude identifica explícitamente AI Visibility Model como primer significado.

Gemini presenta otros significados de AVM en P01 sin identificar explícitamente AI Visibility Model en el texto recuperado de esa respuesta.

Perplexity atribuye inicialmente AVM™ a Admetricks y posteriormente incluye AI Visibility Model entre otros significados.

Por tanto:

P01 no es un caso trivial. Es exactamente el tipo de evidencia frontera que necesitamos para intentar falsar la especificación.

 

28. Estado del documento

AVM™ Experimental Annotation Matrix 0.1

Estado: DRAFT → OPERATIONAL

Corpus

51 unidades verificadas

ChatGPT

Pendiente de incorporación

Variables activas

R01 — Recognition

C01 — Category

Primera unidad experimental

P01 × Gemini

P01 × Claude

P01 × Perplexity

P01 × ChatGPT

 

 

Manu Duque
AI Visibility Specialist
ai-visibility.es

 

Las 8 mejores APIs de SEO en 2026

  Una API de SEO permite consultar datos de posiciones, palabras clave, backlinks o resultados de búsqueda desde tu propio código: envías una petición a un endpoint y recibes JSON estructurado, sin pasar por el

Leer más »
Manu Duque
Resumen de privacidad

Esta web utiliza cookies para que podamos ofrecerte la mejor experiencia de usuario posible. La información de las cookies se almacena en tu navegador y realiza funciones tales como reconocerte cuando vuelves a nuestra web o ayudar a nuestro equipo a comprender qué secciones de la web encuentras más interesantes y útiles.

Nunca almacenamos información personal.

Puedes revisar nuestra política en la página de Política de Privacidad, Condiciones de Uso y Cookies.