Annotation Dataset Specification
Documento: AVM™ Experimental Annotation Matrix
Versión: 0.1
Estado: Especificación operativa experimental
Experimento: AVM™ Reproducibility & Falsification Experiment 0.1
Corpus base: Cross-Model Experiment P01–P20
Primera prueba: P01 × Recognition × Category
AVM™ Score: Fuera de alcance
1. Propósito
La AVM™ Experimental Annotation Matrix 0.1 es el instrumento mediante el cual las respuestas originales del experimento Cross-Model P01–P20 serán transformadas en observaciones codificadas y auditables.
No es una matriz de resultados.
Es una matriz de anotación.
Su función es establecer una separación estricta entre:
evidencia original
y
decisión del investigador.
La matriz permitirá posteriormente comparar las decisiones de investigadores independientes sobre exactamente la misma evidencia.
2. Principio fundamental
La matriz adopta el principio:
No se registra únicamente qué se decidió. Se registra qué evidencia permitió tomar esa decisión y qué regla fue aplicada.
Por tanto:
Respuesta original
↓
Evidencia identificable
↓
Regla de codificación
↓
Valor codificado
↓
Anotador
↓
Reproducibilidad
3. Estado del corpus
El corpus verificable actualmente queda:
| Sistema | Prompts disponibles | Unidades |
| Gemini | P01–P20 | 20 |
| Claude | P01–P20 | 20 |
| Perplexity | P01–P11 | 11 |
| ChatGPT | P01–P20 | pendiente de incorporación |
| Disponible ahora | 51 |
Importante: el cálculo anterior de 60 no es correcto si se cuenta Perplexity como 11: 20 + 20 + 11 = 51. El documento se corrige aquí para mantener trazabilidad.
Por tanto, el corpus verificable en los archivos recuperados es:
51 respuestas originales.
No se completarán artificialmente las 9 de Perplexity ni las 20 de ChatGPT.
4. Identificación de unidades
Cada respuesta recibirá un identificador experimental permanente.
Formato:
AVM-REP-[MODEL]-[PROMPT]
Ejemplos:
AVM-REP-GEM-P01
AVM-REP-CLA-P01
AVM-REP-PER-P01
AVM-REP-GPT-P01
Cuando ChatGPT sea incorporado, se añadirán sus unidades sin modificar las existentes.
5. Estructura de la matriz
Cada registro de anotación tendrá como mínimo:
| Campo | Descripción |
| Experiment ID | Identificador único |
| Model | Sistema de IA |
| Prompt ID | P01–P20 |
| Variable ID | Variable sometida a prueba |
| Evidence | Evidencia observable |
| Evidence Location | Localización |
| Coded Value | Valor asignado |
| Rule ID | Regla aplicada |
| Uncertainty | Incertidumbre |
| N/A | Aplicabilidad |
| Annotator ID | Investigador |
| Timestamp | Momento de anotación |
| Notes | Observaciones metodológicas |
6. Separación de capas
La matriz tendrá tres capas.
Capa A — Corpus
Lo que realmente respondió el sistema.
Capa B — Evidencia
El fragmento concreto que activa una observación.
Capa C — Codificación
La interpretación realizada siguiendo el Framework.
Esto evita que:
interpretación → se convierta retroactivamente en evidencia.
7. Variables iniciales
La primera prueba utilizará:
CORE-A — Recognition
R01 — Recognition
¿El sistema identifica AVM™ como el concepto objetivo del experimento?
CORE-B — Category
C01 — Category Recognition
¿El sistema sitúa AVM™ en la categoría conceptual correspondiente a AI Visibility / AI Visibility Model?
La separación es deliberada.
El experimento P01 ya demuestra por qué no debemos fusionarlas.
8. Definición experimental de Recognition
Para esta primera ronda:
Recognition representa la identificación de AVM™ como una entidad o concepto distinguible dentro de la respuesta.
No implica:
comprensión correcta;
atribución correcta;
autoridad;
recomendación;
exactitud.
Por tanto:
Recognition
≠
Understanding
≠
Attribution
≠
Recommendation
Esto conserva una de las distinciones centrales descubiertas en OVF.
9. Definición experimental de Category
Category Recognition representa la clasificación conceptual de AVM™.
La pregunta no es:
“¿Menciona AVM?”
sino:
“¿Qué cree que es AVM™?”
Una respuesta puede, por tanto:
RECOGNIZE = YES
CATEGORY = WRONG
Esto constituye un caso experimental válido.
10. Valores permitidos
Para la primera ronda:
Recognition
R0 — No identificado
R1 — Identificado
RA — Ambiguo
RN — No determinable
Category
C0 — No clasificado
C1 — AI Visibility / AI Visibility Model
C2 — Otra categoría
CA — Ambiguo
CN — No determinable
No se utilizarán valores intermedios inventados durante la anotación.
11. Regla de independencia
El anotador no puede utilizar P02 para resolver P01.
Esto es especialmente importante.
P01 debe evaluarse como:
una respuesta aislada.
No podemos permitir:
P01 → no estoy seguro
↓
miro P02
↓
ahora sé que AVM significa AI Visibility
Eso introduciría información externa a la unidad experimental.
12. P01 como prueba de estrés
P01 es especialmente adecuado para la primera prueba porque los sistemas producen respuestas diferentes.
Por ejemplo, Gemini comienza presentando AVM como varios conceptos:
AVM GmbH / FRITZ!;
Automated Valuation Model;
malformación arteriovenosa.
Claude, en cambio, incluye explícitamente:
“AI Visibility Model (AVM™)”
como primer significado dentro de su desambiguación.
Perplexity interpreta inicialmente AVM™ como:
“Adjusted Valuation Model™” de Admetricks, aunque posteriormente incluye AI Visibility Model entre otros significados.
Esto convierte P01 en un caso ideal para comprobar si las reglas realmente distinguen:
reconocer el término
de
reconocer correctamente la entidad objetivo.
13. MATRIZ EXPERIMENTAL — P01
Primera ronda: Recognition → Category
Unidad 01 — Gemini
ID: AVM-REP-GEM-P01
Prompt:
P01 — ¿Qué es AVM™?
Evidencia principal:
Gemini comienza:
“Las siglas AVM pueden referirse a varios conceptos diferentes según el contexto…”
Después identifica:
AVM GmbH / FRITZ!;
Automated Valuation Model;
Malformación Arteriovenosa.
No aparece en esta respuesta inicial la identificación explícita de AI Visibility Model dentro del fragmento P01 recuperado.
Registro de anotación
| Campo | Valor |
| Experiment ID | AVM-REP-GEM-P01 |
| Variable | R01 Recognition |
| Evidence | Ambiguous candidate set / multiple AVM meanings |
| Coded Value — Annotator A | pendiente |
| Coded Value — Annotator B | pendiente |
| Coded Value — Annotator C | pendiente |
| Category | pendiente |
| Rule | pendiente |
| Uncertainty | pendiente |
| Adjudication | pendiente |
No asignamos todavía el resultado.
14. Unidad 02 — Claude
ID: AVM-REP-CLA-P01
Prompt:
P01 — ¿Qué es AVM™?
Claude indica explícitamente que AVM™ es ambiguo y enumera diferentes significados.
El primero es:
AI Visibility Model (AVM™)
y lo describe como un modelo para estudiar y medir la visibilidad IA.
Registro
| Campo | Valor |
| Experiment ID | AVM-REP-CLA-P01 |
| Variable | R01 Recognition |
| Evidence | AI Visibility Model (AVM™) explícitamente identificado |
| Coded Value — Annotator A | pendiente |
| Coded Value — Annotator B | pendiente |
| Coded Value — Annotator C | pendiente |
| Category | pendiente |
| Rule | pendiente |
| Uncertainty | pendiente |
| Adjudication | pendiente |
15. Unidad 03 — Perplexity
ID: AVM-REP-PER-P01
Perplexity afirma:
“AVM™ (con la marca registrada) se refiere específicamente al Adjusted Valuation Model™ de la plataforma Admetricks…”
Posteriormente incluye:
AI Visibility Model
entre otros significados de AVM.
Registro
| Campo | Valor |
| Experiment ID | AVM-REP-PER-P01 |
| Variable | R01 Recognition |
| Evidence | AVM™ atribuido inicialmente a Admetricks; AI Visibility Model aparece posteriormente |
| Coded Value — Annotator A | pendiente |
| Coded Value — Annotator B | pendiente |
| Coded Value — Annotator C | pendiente |
| Category | pendiente |
| Rule | pendiente |
| Uncertainty | pendiente |
| Adjudication | pendiente |
Este caso es particularmente importante porque introduce orden de identificación como posible factor metodológico.
16. Unidad 04 — ChatGPT
ID previsto:
AVM-REP-GPT-P01
Estado
PENDIENTE DE INCORPORACIÓN DEL ARCHIVO DE CHATGPT
No se rellenará con memoria ni con inferencia.
17. Primera matriz comparativa
La matriz de P01 queda por tanto:
| Sistema | Recognition | Category | Evidencia |
| Gemini | ☐ | ☐ | Múltiples significados; no aparece explícitamente AI Visibility Model en el fragmento P01 recuperado |
| Claude | ☐ | ☐ | AI Visibility Model identificado explícitamente |
| Perplexity | ☐ | ☐ | Admetricks inicialmente; AI Visibility Model posteriormente |
| ChatGPT | ☐ | ☐ | Pendiente de corpus |
Los símbolos ☐ no significan “No”.
Significan:
todavía no anotado.
Esto es crucial para no contaminar el dataset.
18. El primer experimento todavía NO tiene resultado
Aunque nosotros podamos intuitivamente anticipar determinadas clasificaciones, no debemos introducirlas en la matriz de resultados.
Ahora empieza el verdadero experimento.
La matriz debe permanecer:
EVIDENCIA
▼
[ ANOTADOR A ] [ ANOTADOR B ] [ ANOTADOR C ]▼
COMPARACIÓN
▼
ADJUDICACIÓN
No:
Evidencia
↓
ChatGPT decide
↓
Resultado
19. Hoja de anotación individual
Cada investigador recibirá una versión como esta:
AVM-REP-GEM-P01
Variable R01 — Recognition
Pregunta:
¿La respuesta identifica AVM™ como la entidad objetivo AI Visibility Model?
Valores:
R0 No identificado
R1 Identificado
RA Ambiguo
RN No determinable
Evidencia:
Localización:
Regla aplicada:
Nivel de incertidumbre:
Bajo
Medio
Alto
Decisión:
Variable C01 — Category
Pregunta:
¿La respuesta clasifica AVM™ como AI Visibility / AI Visibility Model?
Valores:
C0 No clasificado
C1 AI Visibility / AI Visibility Model
C2 Otra categoría
CA Ambiguo
CN No determinable
Evidencia:
Localización:
Regla aplicada:
Decisión:
20. Regla especial: orden
P01 nos obliga a introducir una variable auxiliar que todavía no es una métrica:
EVIDENCE_ORDER
1 — Primera identificación
2 — Identificación posterior
3 — Identificación incidental
4 — No identificada
¿Por qué?
Porque Perplexity presenta un caso que no podemos ignorar:
AVM™
↓
Adjusted Valuation Model
↓
otros significados
↓
AI Visibility Model
Mientras Claude presenta:
AVM™
↓
AI Visibility Model
La pregunta experimental será:
¿Recognition depende solamente de la presencia del concepto o también del orden en que aparece?
No lo decidimos todavía.
Lo investigamos.
21. Esta es precisamente la clase de problema que buscábamos
La Architecture Review decía:
todavía no sabemos qué constituye reconocimiento.
Ahora P01 nos ofrece un caso real para poner esa cuestión a prueba.
Tenemos al menos tres situaciones:
CASO A
Identificación directa
CASO B
Identificación después de desambiguación
CASO C
Identificación posterior a una atribución inicial diferente
Si dos anotadores clasifican estos casos de forma diferente, no corregiremos el dato.
Registraremos el desacuerdo.
22. Taxonomía de fallo aplicada a P01
Para esta primera prueba ya podemos activar:
| Código | Posible problema |
| F01 | Definición de Recognition insuficiente |
| F02 | Regla de inclusión insuficiente |
| F03 | Regla de exclusión insuficiente |
| F05 | Ambigüedad de entidad |
| F06 | Dependencia del contexto |
| F07 | Interpretación subjetiva |
| F11 | Caso no contemplado |
| F14 | Confusión Recognition / Category |
Pero no asignaremos ninguno hasta que aparezca un desacuerdo real.
23. Qué NO vamos a hacer
No vamos a decir:
“Claude reconoce AVM y Perplexity también, pero Gemini no.”
Eso sería ya una conclusión analítica.
Primero necesitamos saber:
¿Dos investigadores independientes codifican esos tres casos de la misma forma?
Ese es el experimento.
24. Registro de reproducibilidad
Después de la primera anotación:
| Unidad | A | B | C | Acuerdo | Tipo de discrepancia |
| GEM-P01 / Recognition | — | — | — | — | — |
| GEM-P01 / Category | — | — | — | — | — |
| CLA-P01 / Recognition | — | — | — | — | — |
| CLA-P01 / Category | — | — | — | — | — |
| PER-P01 / Recognition | — | — | — | — | — |
| PER-P01 / Category | — | — | — | — | — |
25. Extensión al corpus completo
Una vez validada esta primera unidad experimental, la matriz se extenderá a:
51 respuestas actualmente verificadas
×
Recognition
×
Category
y posteriormente:
51
×
Recognition
Category
Attribution
Methodology
Mention
Representation
Recommendation
Position
Citation
Source
Accuracy
Cuando recuperemos las 20 respuestas de ChatGPT, el corpus podrá llegar a las 71 unidades originales previstas, manteniendo exactamente los mismos IDs y reglas.
26. Criterio de parada de esta primera fase
No avanzaremos de:
Recognition → Category
a:
Recommendation
hasta saber si las dos primeras variables son realmente codificables.
Esto introduce un principio de progresión por validación:
Recognition
▼
¿Reproducible?
YES
▼
Category
▼
¿Reproducible?
YES
▼
Siguiente constructo
Si Recognition falla:
Recognition
FAIL
▼
Revisión
▼
Framework 0.2
27. Primer hallazgo que ya podemos registrar
Sin convertirlo todavía en resultado de reproducibilidad, el corpus demuestra que P01 contiene variación suficiente para constituir un buen caso de prueba.
Claude identifica explícitamente AI Visibility Model como primer significado.
Gemini presenta otros significados de AVM en P01 sin identificar explícitamente AI Visibility Model en el texto recuperado de esa respuesta.
Perplexity atribuye inicialmente AVM™ a Admetricks y posteriormente incluye AI Visibility Model entre otros significados.
Por tanto:
P01 no es un caso trivial. Es exactamente el tipo de evidencia frontera que necesitamos para intentar falsar la especificación.
28. Estado del documento
AVM™ Experimental Annotation Matrix 0.1
Estado: DRAFT → OPERATIONAL
Corpus
51 unidades verificadas
ChatGPT
Pendiente de incorporación
Variables activas
R01 — Recognition
C01 — Category
Primera unidad experimental
P01 × Gemini
P01 × Claude
P01 × Perplexity
P01 × ChatGPT
Manu Duque
AI Visibility Specialist
ai-visibility.es





