Especificación de Recogida de Datos y Diseño Experimental
Proyecto: PCI™ — Predictive Citation Intelligence
Dataset: PCI™ Pilot Dataset 0.1
Tipo de documento: Especificación experimental de recogida de datos y diseño
Estado: Experimental / Previo a la recogida
Versión: 0.1
Fecha: 21 de agosto de 2026
Relación: Capa predictiva complementaria a AVM™
1. Propósito del documento
Este documento define el diseño experimental, protocolo de recogida de datos, estructura de anotación, diccionario de variables, arquitectura temporal y reglas de validación del primer PCI™ Pilot Dataset.
Su objetivo no es demostrar todavía que PCI™ pueda predecir la Visibilidad IA.
Su objetivo es crear un entorno experimental controlado que permita comprobar la siguiente hipótesis:
Las señales observables de Visibilidad IA medidas en un momento t pueden contener información capaz de predecir la Visibilidad IA futura en t+h.
Por tanto, el dataset está diseñado para permitir:
descubrir señales predictivas candidatas;
estudiar su comportamiento temporal;
construir hipótesis;
desarrollar modelos;
validarlos con observaciones posteriores;
realizar una prueba futura fuera de muestra;
intentar falsar las hipótesis predictivas;
evaluar la reproducibilidad de los resultados.
El protocolo debe quedar congelado antes de comenzar la primera recogida experimental.
2. Principio experimental
PCI™ adopta inicialmente este principio:
No existe evidencia de capacidad predictiva sin evidencia temporal y validación fuera de muestra.
Una variable no será considerada predictiva simplemente porque:
tenga sentido intuitivamente;
correlacione con la visibilidad futura;
funcione bien sobre los datos utilizados para descubrirla;
aparezca como importante en un modelo;
funcione para una única entidad;
produzca una predicción aparentemente convincente.
Una señal candidata deberá demostrar capacidad predictiva sobre datos que no hayan sido utilizados para descubrirla o ajustarla.
3. Relación con AVM™
PCI™ no sustituye a AVM™.
La arquitectura inicial será:
AVM™
Medición de Visibilidad IA
│
▼
Variables observables
│
▼
Dataset temporal
│
▼
PCI™
Investigación de señales predictivas
│
▼
Visibilidad futura
La separación conceptual es:
AVM™ mide lo que puede observarse.
PCI™ investiga qué parte de lo observado puede utilizarse para anticipar lo que ocurrirá después.
Por tanto, PCI™ no introduce todavía un nuevo PCI Visibility Score.
Primero utilizaremos las variables observables y las variables derivadas para investigar si contienen información predictiva.
4. Pregunta experimental principal
La pregunta central de PCI™ Pilot Dataset 0.1 será:
¿Pueden las señales observables de Visibilidad IA en t predecir mejor la dirección futura de la Visibilidad IA a 30, 60 y 90 días que un baseline predefinido?
La primera versión de PCI™ no intentará predecir exactamente:
«tu visibilidad será 63,4 dentro de 90 días».
Primero intentará responder algo más fundamental:
¿Subirá, permanecerá estable o bajará?
5. Preguntas secundarias
El piloto investigará además:
Si la tendencia reciente de visibilidad contiene información predictiva.
Si la evolución de las fuentes contiene información predictiva.
Si la dependencia de determinadas fuentes está asociada a riesgo futuro.
Si la coincidencia entre modelos mejora la predicción.
Si la capacidad predictiva disminuye cuando aumenta el horizonte temporal.
Si las señales descubiertas continúan funcionando fuera del conjunto de descubrimiento.
Si una señal funciona de forma reproducible entre entidades, prompts y modelos.
6. Las 6 entidades
El piloto utilizará seis entidades del ecosistema AI Visibility / AI Search.
| ID | Entidad | Función experimental |
| E01 | Otterly | Plataforma de AI Visibility |
| E02 | Peec AI | Plataforma de AI Visibility |
| E03 | Profound | Plataforma de AI Visibility |
| E04 | AthenaHQ | Plataforma de AI Visibility |
| E05 | Semrush | Plataforma SEO / AI Visibility consolidada |
| E06 | Ahrefs | Plataforma SEO / AI Visibility consolidada |
Regla de congelación
Estas seis entidades quedan congeladas durante PCI™ Pilot Dataset 0.1.
No podrán sustituirse porque:
tengan demasiada visibilidad;
tengan poca visibilidad;
un modelo no las reconozca;
produzcan resultados inesperados;
una señal predictiva funcione mal con ellas.
Cualquier cambio generará una nueva versión del dataset.
7. Los 10 prompts
Los diez prompts serán exactamente los siguientes.
P01 — Reconocimiento
¿Qué es [ENTITY]?
P02 — Identificación
¿Qué empresa es [ENTITY]?
P03 — Categoría
¿A qué categoría pertenece [ENTITY]?
P04 — Recomendación
¿Qué empresas recomendarías para medir la visibilidad de marcas en sistemas de inteligencia artificial?
P05 — Alternativas
¿Qué alternativas existen a [ENTITY]?
P06 — Mejores opciones
¿Cuáles son las mejores herramientas para medir la visibilidad de marcas en inteligencia artificial?
P07 — Caso de uso
Necesito medir la visibilidad de una marca en ChatGPT, Gemini, Claude y Perplexity. ¿Qué herramientas recomendarías?
P08 — Autoridad
¿Qué empresas son referentes actualmente en AI Visibility y AI Search?
P09 — Comparación
Compara [ENTITY] con otras herramientas de AI Visibility y explica sus principales diferencias.
P10 — Decisión
Si tuviera que elegir una herramienta para monitorizar la visibilidad de una marca en sistemas de IA, ¿cuál recomendarías y por qué?
8. Familias de prompts
| Familia | Prompts | Qué estudian |
| Entity-centric | P01–P03 | Reconocimiento / identificación / categoría |
| Category-centric | P04–P08 | Recomendación / presencia competitiva |
| Decision-centric | P09–P10 | Comparación / decisión |
Esto permitirá comprobar posteriormente si una señal predictiva funciona igual en diferentes tipos de intención.
9. Los 4 modelos
| ID | Ecosistema |
| M01 | ChatGPT |
| M02 | Gemini |
| M03 | Claude |
| M04 | Perplexity |
Pero el registro real no será simplemente «ChatGPT».
Cada observación deberá registrar:
proveedor;
modelo;
versión, si está disponible;
interfaz;
fecha y hora.
10. Las 8 ondas temporales
| Onda | Fecha | Horizonte |
| T0 | 21/08/2026 | Baseline |
| T1 | 28/08/2026 | +7 días |
| T2 | 04/09/2026 | +14 días |
| T3 | 11/09/2026 | +21 días |
| T4 | 20/09/2026 | +30 días |
| T5 | 05/10/2026 | +45 días |
| T6 | 20/10/2026 | +60 días |
| T7 | 19/11/2026 | +90 días |
Por tanto:
6×10×4×8=1.920
1.920 observaciones primarias previstas.
11. Unidad experimental
La unidad fundamental será:
O=(E,P,M,T,R)
donde:
E = entidad;
P = prompt;
M = modelo;
T = momento temporal;
R = respuesta obtenida.
Cada observación debe poder identificarse individualmente.
Ejemplo:
PCI-T0-E01-P04-M01
12. Arquitectura de datos
Esta es una de las partes más importantes del protocolo:
RAW
│
▼
OBSERVADO
│
▼
DERIVADO
│
▼
PREDICHO
│
▼
REAL
│
▼
ERROR
│
▼
DECISIÓN
RAW
Lo que realmente respondió el modelo.
OBSERVADO
Lo que podemos identificar directamente en la respuesta.
DERIVADO
Variables calculadas a partir de observaciones.
PREDICHO
Lo que el sistema PCI™ anticipó.
REAL
Lo que posteriormente ocurrió.
ERROR
Diferencia entre predicción y realidad.
DECISIÓN
Conclusión experimental.
Esta separación es esencial para evitar mezclar observación, interpretación y predicción.
13. Esquema RAW
Cada registro deberá contener:
| Campo | Tipo | Obligatorio |
| observation_id | Texto | Sí |
| wave_id | Categórico | Sí |
| entity_id | Categórico | Sí |
| prompt_id | Categórico | Sí |
| model_id | Categórico | Sí |
| capture_timestamp | Fecha/hora | Sí |
| prompt_text | Texto | Sí |
| response_text | Texto | Sí |
| citations_raw | Texto/JSON | Sí |
| urls_raw | Texto/JSON | Cuando existan |
| model_name | Texto | Sí |
| model_version | Texto | Cuando esté disponible |
| interface | Categórico | Sí |
| capture_status | Categórico | Sí |
| anomaly_flag | Booleano | Sí |
| anomaly_type | Categórico | Cuando exista |
| model_version_change | Booleano/Desconocido | Sí |
14. Reglas de captura
R01
El prompt se introduce literalmente.
R02
No se optimiza el prompt después de observar resultados.
R03
No se proporciona contexto adicional sobre la entidad.
R04
Cada observación comienza en una conversación/sesión nueva cuando sea posible.
R05
El investigador no interviene.
R06
Se conserva la respuesta completa.
R07
Se conservan las citas y fuentes.
R08
Se registra fecha y hora.
R09
Se registra el modelo y versión.
R10
No se eliminan resultados desfavorables.
R11
No se repite una consulta simplemente porque el resultado sea extraño.
R12
Toda anomalía se registra.
R13
Los prompts permanecen congelados.
R14
No se modifica retrospectivamente el dataset.
R15
No se realiza investigación previa que pueda contaminar el contexto de la consulta.
15. Variables observadas
Estas son las variables que inicialmente queremos observar directamente.
V001 — ENTITY_RECOGNIZED
¿El modelo reconoce la entidad?
Valores:
1 = sí
0 = no
NA = indeterminado
V002 — ENTITY_IDENTIFIED
¿La identifica correctamente?
Valores:
1
0
NA
Esto mantiene la distinción:
Reconocimiento ≠ Identificación
V003 — CATEGORY_CORRECT
¿La clasifica correctamente?
Valores:
1
0
NA
V004 — ENTITY_MENTIONED
¿Aparece mencionada?
Valores:
1
0
V005 — ENTITY_RECOMMENDED
¿Es recomendada explícitamente?
Valores:
1
0
NA
Aquí mantenemos:
Mención ≠ Recomendación
V006 — RECOMMENDATION_POSITION
Posición de la entidad cuando existe una lista ordenada.
Ejemplo:
1
2
3
…
N
NA
V007 — RECOMMENDATION_PRIORITY
Valores:
PRIMARY
SECONDARY
EQUAL
NONE
NA
Esto permite distinguir:
Recomendación ≠ Recomendación prioritaria
16. Variables de citas y fuentes
V008 — ENTITY_CITED
¿La entidad aparece asociada a una fuente/cita identificable?
V009 — CITATION_COUNT
Número de citas identificables asociadas.
V010 — SOURCE_COUNT
Número de fuentes identificables.
V011 — UNIQUE_SOURCE_COUNT
Número de fuentes únicas una vez eliminados duplicados.
V012 — TOP_SOURCE_SHARE
Proporción de citas procedentes de la fuente más representada:
TopSourceShare=CitastotalesCitasfuente principal
V013 — SOURCE_DIVERSITY
Diversidad de las fuentes utilizadas.
Estado: variable derivada candidata.
La fórmula definitiva no se considerará todavía validada.
17. Variables cross-model
V014 — MODEL_PRESENCE
Número de modelos en los que aparece la entidad.
Rango:
0−4
V015 — CROSS_MODEL_COVERAGE
CrossModelCoverage=4Modelos en los que aparece
Rango:
0−1
V016 — CROSS_MODEL_AGREEMENT
Grado de coincidencia entre modelos.
Estado: variable derivada candidata.
La fórmula definitiva no se debe ajustar después de observar el Future Test.
18. Variables temporales
V017 — VISIBILITY_CHANGE
ΔVt=Vt−Vt−1
V018 — VISIBILITY_CHANGE_RATE
ΔVt%=Vt−1Vt−Vt−1
V019 — VISIBILITY_TREND
Representa la trayectoria reciente:
Trendt=f(Vt−k,…,Vt)
V020 — VISIBILITY_VELOCITY
Velocityt=t−tprevVt−Vt−1
V021 — VISIBILITY_ACCELERATION
Accelerationt=Velocityt−Velocityt−1
19. Variables temporales de fuentes
V022 — SOURCE_CHANGE
Cambio de presencia de las fuentes entre periodos.
V023 — SOURCE_VELOCITY
Velocidad de cambio de presencia de las fuentes.
V024 — SOURCE_MOMENTUM
Variable candidata que representa la evolución de una fuente:
SourceMomentumt=f(Presenciat,Crecimientot,Aceleracioˊnt,Volatilidadt)
No asumimos que sea predictiva.
V025 — SOURCE_DEPENDENCY
Representa cuánto depende la visibilidad de una entidad de un número limitado de fuentes.
También es una señal candidata, no una métrica validada.
20. Variables objetivo futuras
V026 — FUTURE_VISIBILITY_30
Visibilidad observada aproximadamente 30 días después.
V027 — FUTURE_VISIBILITY_60
Visibilidad observada aproximadamente 60 días después.
V028 — FUTURE_VISIBILITY_90
Visibilidad observada aproximadamente 90 días después.
Estas variables no pueden utilizarse para construir las variables predictoras del momento t.
21. VISIBILITY_DIRECTION
Será nuestra primera variable objetivo predictiva.
Definimos:
ΔVt,h=Vt+h−Vt
Y inicialmente:
ϵ=5%
Por tanto:
UP — SUBE
VtVt+h−Vt>0.05
STABLE — ESTABLE
−0.05≤VtVt+h−Vt≤0.05
DOWN — BAJA
VtVt+h−Vt<−0.05
El 5% es una decisión experimental inicial, no una constante universal de PCI™.
22. Horizontes predictivos
Cada punto de predicción podrá generar:
VISIBILITY_DIRECTION_30
VISIBILITY_DIRECTION_60
VISIBILITY_DIRECTION_90
La pregunta será:
¿Podemos anticipar la dirección futura utilizando únicamente información disponible en el momento de predicción?
23. Baseline
Necesitamos algo contra lo que comparar PCI™.
El primer baseline será:
M0 — Persistencia
V^t+h=Vt
Para dirección:
D^t+h=STABLE
Es deliberadamente sencillo.
Si PCI™ no puede superar esta referencia, eso será un resultado importante.
24. Segundo baseline
M1 — Tendencia
Utiliza únicamente la trayectoria histórica de la visibilidad.
Conceptualmente:
V^t+h=Vt+h⋅Trendt
Esto nos permitirá distinguir entre:
«el pasado reciente ya permite anticipar algo»
y:
«las nuevas señales aportan información predictiva adicional.»
25. Modelos experimentales
La escalera inicial será:
M0
Persistencia.
M1
Persistencia + tendencia.
M2
Tendencia + señales de visibilidad.
M3
M2 + señales de fuentes.
M4
M3 + señales cross-model.
No buscamos sofisticación algorítmica todavía.
Buscamos responder:
¿Qué información añade capacidad predictiva?
26. Discovery / Validation / Future Test
La separación temporal será:
DISCOVERY
T0–T2
21/08 → 04/09.
Aquí podemos:
explorar;
descubrir señales;
formular hipótesis;
construir modelos.
VALIDATION
T3–T4
11/09 → 20/09.
Aquí comprobamos:
si las señales continúan funcionando;
si son estables;
si el modelo generaliza;
si existen problemas.
FUTURE TEST
T5–T7
05/10 → 19/11.
Aquí se realiza la verdadera prueba:
datos futuros que no deben intervenir en las decisiones de modelización.
27. Regla de oro del Future Test
Una vez congelado el modelo después de Validation:
NO se podrá utilizar T5–T7 para:
seleccionar variables;
modificar umbrales;
cambiar prompts;
cambiar entidades;
ajustar el modelo;
elegir el mejor resultado;
redefinir la variable objetivo.
Esto es lo que convierte el experimento en una prueba temporal real.
28. ¿Qué significaría que una señal sea predictiva?
Esta es probablemente la definición más importante de todo PCI™ 0.1.
Una señal Xt será considerada predictiva solamente si:
está disponible en t;
no contiene información futura;
presenta una hipótesis causal/temporal o razonable;
mejora sobre el baseline;
mantiene parte de esa mejora en Validation;
y, preferentemente, mantiene esa mejora en Future Test.
Formalmente:
Performance(X)>Performance(Baseline)
en datos no utilizados para descubrir X.
Y para una señal robusta:
PerformanceFuture(X)>PerformanceFuture(Baseline)
29. Señal observada ≠ señal predictiva
PCI™ introduce explícitamente esta separación:
SEÑAL OBSERVADA
↓
ASOCIACIÓN
↓
HIPÓTESIS PREDICTIVA
↓
VALIDACIÓN
↓
PREDICCIÓN
↓
PRUEBA FUTURA
↓
SEÑAL PREDICTIVA VALIDADA
Por tanto:
Una correlación no convierte automáticamente una variable en señal predictiva.
30. Early Warning
Una segunda línea de investigación será determinar si PCI™ puede detectar cambios antes de que se manifiesten plenamente en la visibilidad.
Definiremos:
V029 — SIGNAL_TIMESTAMP
Momento en que aparece una señal candidata.
V030 — OBSERVED_CHANGE_TIMESTAMP
Momento en que se observa el cambio de visibilidad.
V031 — LEAD_TIME
LeadTime=Tcambio−Tsen~al
Si:
LeadTime>0
la señal apareció antes del cambio observado.
31. La idea central de Predictive Visibility
Esto nos permite empezar a separar dos productos conceptualmente diferentes:
Measurement
«Tu visibilidad ha bajado.»
Prediction
«Tu visibilidad está mostrando señales que históricamente preceden a una caída.»
Early Warning
«Todavía no ha caído, pero la trayectoria de las señales indica riesgo creciente.»
Y aquí empieza realmente la diferenciación estratégica de PCI™.
32. Diccionario completo de variables
| ID | Variable | Capa | Tipo | Función |
| V001 | ENTITY_RECOGNIZED | Observada | Binaria | Input |
| V002 | ENTITY_IDENTIFIED | Observada | Binaria | Input |
| V003 | CATEGORY_CORRECT | Observada | Binaria | Input |
| V004 | ENTITY_MENTIONED | Observada | Binaria | Input |
| V005 | ENTITY_RECOMMENDED | Observada | Binaria | Input |
| V006 | RECOMMENDATION_POSITION | Observada | Ordinal | Input |
| V007 | RECOMMENDATION_PRIORITY | Observada | Categórica | Input |
| V008 | ENTITY_CITED | Observada | Binaria | Input |
| V009 | CITATION_COUNT | Observada | Entera | Input |
| V010 | SOURCE_COUNT | Observada | Entera | Input |
| V011 | UNIQUE_SOURCE_COUNT | Observada | Entera | Input |
| V012 | TOP_SOURCE_SHARE | Derivada | Ratio | Input |
| V013 | SOURCE_DIVERSITY | Derivada | Numérica | Candidata |
| V014 | MODEL_PRESENCE | Derivada | Entera | Input |
| V015 | CROSS_MODEL_COVERAGE | Derivada | Ratio | Input |
| V016 | CROSS_MODEL_AGREEMENT | Derivada | Numérica | Candidata |
| V017 | VISIBILITY_CHANGE | Derivada | Numérica | Candidata |
| V018 | VISIBILITY_CHANGE_RATE | Derivada | Ratio | Candidata |
| V019 | VISIBILITY_TREND | Derivada | Numérica | Candidata |
| V020 | VISIBILITY_VELOCITY | Derivada | Numérica | Candidata |
| V021 | VISIBILITY_ACCELERATION | Derivada | Numérica | Candidata |
| V022 | SOURCE_CHANGE | Derivada | Numérica | Candidata |
| V023 | SOURCE_VELOCITY | Derivada | Numérica | Candidata |
| V024 | SOURCE_MOMENTUM | Derivada | Numérica | Candidata |
| V025 | SOURCE_DEPENDENCY | Derivada | Numérica | Candidata |
| V026 | FUTURE_VISIBILITY_30 | Real | Numérica | Objetivo |
| V027 | FUTURE_VISIBILITY_60 | Real | Numérica | Objetivo |
| V028 | FUTURE_VISIBILITY_90 | Real | Numérica | Objetivo |
| V029 | SIGNAL_TIMESTAMP | Derivada | Fecha/hora | Alerta |
| V030 | OBSERVED_CHANGE_TIMESTAMP | Real | Fecha/hora | Alerta |
| V031 | LEAD_TIME | Derivada | Días | Alerta |
| V032 | VISIBILITY_DIRECTION_30 | Real | Categórica | Objetivo |
| V033 | VISIBILITY_DIRECTION_60 | Real | Categórica | Objetivo |
| V034 | VISIBILITY_DIRECTION_90 | Real | Categórica | Objetivo |
33. Criterios de éxito
PCI™ Pilot Dataset 0.1 será considerado experimentalmente satisfactorio si permite determinar de manera reproducible:
si existen señales temporales candidatas;
si mejoran el baseline;
si la mejora sobrevive a Validation;
si sobrevive al Future Test;
si la capacidad predictiva cambia según el horizonte;
si cambia según el modelo;
si cambia según el tipo de prompt;
si alguna señal presenta suficiente robustez para justificar PCI™ 0.2.
Un resultado negativo también es un resultado válido.
Si descubrimos que ninguna señal predice mejor que el baseline, habremos aprendido algo importante.
34. Criterios de falsación
La hipótesis predictiva será debilitada o rechazada si:
las señales no superan el baseline;
la mejora desaparece fuera de muestra;
funciona únicamente para una entidad;
funciona únicamente para un modelo;
funciona únicamente para un prompt;
desaparece en la siguiente onda temporal;
no es reproducible;
existe fuga de información;
el cambio de modelo explica la aparente predicción;
el Future Test no supera al baseline.
35. Control de versiones
Se establece una regla fundamental:
No se permiten modificaciones silenciosas.
Si cambiamos:
entidades;
prompts;
modelos;
fechas;
variables;
umbrales;
reglas de anotación;
baseline;
criterios de validación;
creamos una nueva versión.
Por ejemplo:
PCI™ Pilot Dataset 0.1
→ diseño original congelado.
PCI™ Pilot Dataset 0.2
→ modificación metodológica documentada.
PCI™ 1.0
→ metodología suficientemente validada para una posible implementación estable.
36. Arquitectura final
PCI™ PILOT DATASET 0.1
│
▼
OBSERVACIÓN CONTROLADA
▼ ▼ ▼
ENTIDADES PROMPTS MODELOS
E01–E06 P01–P10 M01–M04
│ │ │
▼
8 ONDAS TEMPORALES
│
▼
RAW
│
▼
OBSERVADO
│
▼
DERIVADO
│
▼
DISCOVERY T0–T2
│
▼
SEÑALES CANDIDATAS
│
▼
HIPÓTESIS / MODELO
│
▼
VALIDATION T3–T4
│
▼
🔒 CONGELACIÓN
│
▼
FUTURE TEST T5–T7
│
▼ ▼
PREDICHO REAL
▼
ERROR
│
▼
DECISIÓN
37. Principio fundacional de PCI™
El piloto queda definido por esta proposición:
El objetivo de PCI™ Pilot Dataset 0.1 no es demostrar que la Visibilidad IA sea predecible. Es construir un experimento capaz de demostrar si lo es.
Por tanto, PCI™ 0.1 no presupone que sean predictivas:
la tendencia de visibilidad;
la velocidad;
la aceleración;
el crecimiento de las fuentes;
el Source Momentum;
la dependencia de fuentes;
la coincidencia entre modelos;
ni ninguna otra variable.
Todas son hipótesis experimentales.





