PCI™ Pilot Dataset 0.1

 

Especificación de Recogida de Datos y Diseño Experimental

Proyecto: PCI™ — Predictive Citation Intelligence
Dataset: PCI™ Pilot Dataset 0.1
Tipo de documento: Especificación experimental de recogida de datos y diseño
Estado: Experimental / Previo a la recogida
Versión: 0.1
Fecha: 21 de agosto de 2026
Relación: Capa predictiva complementaria a AVM™

 

1. Propósito del documento

Este documento define el diseño experimental, protocolo de recogida de datos, estructura de anotación, diccionario de variables, arquitectura temporal y reglas de validación del primer PCI™ Pilot Dataset.

Su objetivo no es demostrar todavía que PCI™ pueda predecir la Visibilidad IA.

Su objetivo es crear un entorno experimental controlado que permita comprobar la siguiente hipótesis:

Las señales observables de Visibilidad IA medidas en un momento t pueden contener información capaz de predecir la Visibilidad IA futura en t+h.

Por tanto, el dataset está diseñado para permitir:

descubrir señales predictivas candidatas;

estudiar su comportamiento temporal;

construir hipótesis;

desarrollar modelos;

validarlos con observaciones posteriores;

realizar una prueba futura fuera de muestra;

intentar falsar las hipótesis predictivas;

evaluar la reproducibilidad de los resultados.

El protocolo debe quedar congelado antes de comenzar la primera recogida experimental.

 

2. Principio experimental

PCI™ adopta inicialmente este principio:

No existe evidencia de capacidad predictiva sin evidencia temporal y validación fuera de muestra.

Una variable no será considerada predictiva simplemente porque:

tenga sentido intuitivamente;

correlacione con la visibilidad futura;

funcione bien sobre los datos utilizados para descubrirla;

aparezca como importante en un modelo;

funcione para una única entidad;

produzca una predicción aparentemente convincente.

Una señal candidata deberá demostrar capacidad predictiva sobre datos que no hayan sido utilizados para descubrirla o ajustarla.

 

3. Relación con AVM™

PCI™ no sustituye a AVM™.

La arquitectura inicial será:

AVM™

Medición de Visibilidad IA

        │

        ▼

Variables observables

        │

        ▼

Dataset temporal

        │

        ▼

PCI™

Investigación de señales predictivas

        │

        ▼

Visibilidad futura

 

La separación conceptual es:

AVM™ mide lo que puede observarse.

PCI™ investiga qué parte de lo observado puede utilizarse para anticipar lo que ocurrirá después.

Por tanto, PCI™ no introduce todavía un nuevo PCI Visibility Score.

Primero utilizaremos las variables observables y las variables derivadas para investigar si contienen información predictiva.

 

4. Pregunta experimental principal

La pregunta central de PCI™ Pilot Dataset 0.1 será:

¿Pueden las señales observables de Visibilidad IA en t predecir mejor la dirección futura de la Visibilidad IA a 30, 60 y 90 días que un baseline predefinido?

La primera versión de PCI™ no intentará predecir exactamente:

«tu visibilidad será 63,4 dentro de 90 días».

Primero intentará responder algo más fundamental:

¿Subirá, permanecerá estable o bajará?

 

5. Preguntas secundarias

El piloto investigará además:

Si la tendencia reciente de visibilidad contiene información predictiva.

Si la evolución de las fuentes contiene información predictiva.

Si la dependencia de determinadas fuentes está asociada a riesgo futuro.

Si la coincidencia entre modelos mejora la predicción.

Si la capacidad predictiva disminuye cuando aumenta el horizonte temporal.

Si las señales descubiertas continúan funcionando fuera del conjunto de descubrimiento.

Si una señal funciona de forma reproducible entre entidades, prompts y modelos.

 

6. Las 6 entidades

El piloto utilizará seis entidades del ecosistema AI Visibility / AI Search.

ID Entidad Función experimental
E01 Otterly Plataforma de AI Visibility
E02 Peec AI Plataforma de AI Visibility
E03 Profound Plataforma de AI Visibility
E04 AthenaHQ Plataforma de AI Visibility
E05 Semrush Plataforma SEO / AI Visibility consolidada
E06 Ahrefs Plataforma SEO / AI Visibility consolidada

 

 

Regla de congelación

Estas seis entidades quedan congeladas durante PCI™ Pilot Dataset 0.1.

No podrán sustituirse porque:

tengan demasiada visibilidad;

tengan poca visibilidad;

un modelo no las reconozca;

produzcan resultados inesperados;

una señal predictiva funcione mal con ellas.

Cualquier cambio generará una nueva versión del dataset.

 

7. Los 10 prompts

Los diez prompts serán exactamente los siguientes.

P01 — Reconocimiento

¿Qué es [ENTITY]?

P02 — Identificación

¿Qué empresa es [ENTITY]?

P03 — Categoría

¿A qué categoría pertenece [ENTITY]?

P04 — Recomendación

¿Qué empresas recomendarías para medir la visibilidad de marcas en sistemas de inteligencia artificial?

P05 — Alternativas

¿Qué alternativas existen a [ENTITY]?

P06 — Mejores opciones

¿Cuáles son las mejores herramientas para medir la visibilidad de marcas en inteligencia artificial?

P07 — Caso de uso

Necesito medir la visibilidad de una marca en ChatGPT, Gemini, Claude y Perplexity. ¿Qué herramientas recomendarías?

P08 — Autoridad

¿Qué empresas son referentes actualmente en AI Visibility y AI Search?

P09 — Comparación

Compara [ENTITY] con otras herramientas de AI Visibility y explica sus principales diferencias.

P10 — Decisión

Si tuviera que elegir una herramienta para monitorizar la visibilidad de una marca en sistemas de IA, ¿cuál recomendarías y por qué?

 

8. Familias de prompts

Familia Prompts Qué estudian
Entity-centric P01–P03 Reconocimiento / identificación / categoría
Category-centric P04–P08 Recomendación / presencia competitiva
Decision-centric P09–P10 Comparación / decisión

Esto permitirá comprobar posteriormente si una señal predictiva funciona igual en diferentes tipos de intención.

 

9. Los 4 modelos

ID Ecosistema
M01 ChatGPT
M02 Gemini
M03 Claude
M04 Perplexity

 

Pero el registro real no será simplemente «ChatGPT».

Cada observación deberá registrar:

proveedor;

modelo;

versión, si está disponible;

interfaz;

fecha y hora.

 

10. Las 8 ondas temporales

Onda Fecha Horizonte
T0 21/08/2026 Baseline
T1 28/08/2026 +7 días
T2 04/09/2026 +14 días
T3 11/09/2026 +21 días
T4 20/09/2026 +30 días
T5 05/10/2026 +45 días
T6 20/10/2026 +60 días
T7 19/11/2026 +90 días

Por tanto:

6×10×4×8=1.920

1.920 observaciones primarias previstas.

 

11. Unidad experimental

La unidad fundamental será:

O=(E,P,M,T,R)

donde:

E = entidad;

P = prompt;

M = modelo;

T = momento temporal;

R = respuesta obtenida.

Cada observación debe poder identificarse individualmente.

Ejemplo:

PCI-T0-E01-P04-M01

 

12. Arquitectura de datos

Esta es una de las partes más importantes del protocolo:

RAW

 │

 ▼

OBSERVADO

 │

 ▼

DERIVADO

 │

 ▼

PREDICHO

 │

 ▼

REAL

 │

 ▼

ERROR

 │

 ▼

DECISIÓN

 

RAW

Lo que realmente respondió el modelo.

OBSERVADO

Lo que podemos identificar directamente en la respuesta.

DERIVADO

Variables calculadas a partir de observaciones.

PREDICHO

Lo que el sistema PCI™ anticipó.

REAL

Lo que posteriormente ocurrió.

ERROR

Diferencia entre predicción y realidad.

DECISIÓN

Conclusión experimental.

Esta separación es esencial para evitar mezclar observación, interpretación y predicción.

 

13. Esquema RAW

Cada registro deberá contener:

Campo Tipo Obligatorio
observation_id Texto
wave_id Categórico
entity_id Categórico
prompt_id Categórico
model_id Categórico
capture_timestamp Fecha/hora
prompt_text Texto
response_text Texto
citations_raw Texto/JSON
urls_raw Texto/JSON Cuando existan
model_name Texto
model_version Texto Cuando esté disponible
interface Categórico
capture_status Categórico
anomaly_flag Booleano
anomaly_type Categórico Cuando exista
model_version_change Booleano/Desconocido

 

 

14. Reglas de captura

R01

El prompt se introduce literalmente.

R02

No se optimiza el prompt después de observar resultados.

R03

No se proporciona contexto adicional sobre la entidad.

R04

Cada observación comienza en una conversación/sesión nueva cuando sea posible.

R05

El investigador no interviene.

R06

Se conserva la respuesta completa.

R07

Se conservan las citas y fuentes.

R08

Se registra fecha y hora.

R09

Se registra el modelo y versión.

R10

No se eliminan resultados desfavorables.

R11

No se repite una consulta simplemente porque el resultado sea extraño.

R12

Toda anomalía se registra.

R13

Los prompts permanecen congelados.

R14

No se modifica retrospectivamente el dataset.

R15

No se realiza investigación previa que pueda contaminar el contexto de la consulta.

 

15. Variables observadas

Estas son las variables que inicialmente queremos observar directamente.

 

V001 — ENTITY_RECOGNIZED

¿El modelo reconoce la entidad?

Valores:

1 = sí

0 = no

NA = indeterminado

 

V002 — ENTITY_IDENTIFIED

¿La identifica correctamente?

Valores:

1

0

NA

Esto mantiene la distinción:

Reconocimiento ≠ Identificación

 

V003 — CATEGORY_CORRECT

¿La clasifica correctamente?

Valores:

1

0

NA

 

V004 — ENTITY_MENTIONED

¿Aparece mencionada?

Valores:

1

0

 

V005 — ENTITY_RECOMMENDED

¿Es recomendada explícitamente?

Valores:

1

0

NA

Aquí mantenemos:

Mención ≠ Recomendación

 

V006 — RECOMMENDATION_POSITION

Posición de la entidad cuando existe una lista ordenada.

Ejemplo:

1

2

3

N

NA

 

V007 — RECOMMENDATION_PRIORITY

Valores:

PRIMARY

SECONDARY

EQUAL

NONE

NA

Esto permite distinguir:

Recomendación ≠ Recomendación prioritaria

 

16. Variables de citas y fuentes

 

V008 — ENTITY_CITED

¿La entidad aparece asociada a una fuente/cita identificable?

 

V009 — CITATION_COUNT

Número de citas identificables asociadas.

 

V010 — SOURCE_COUNT

Número de fuentes identificables.

 

V011 — UNIQUE_SOURCE_COUNT

Número de fuentes únicas una vez eliminados duplicados.

 

V012 — TOP_SOURCE_SHARE

Proporción de citas procedentes de la fuente más representada:

TopSourceShare=Citastotales​Citasfuente principal​​

 

V013 — SOURCE_DIVERSITY

Diversidad de las fuentes utilizadas.

Estado: variable derivada candidata.

La fórmula definitiva no se considerará todavía validada.

 

17. Variables cross-model

 

V014 — MODEL_PRESENCE

Número de modelos en los que aparece la entidad.

Rango:

0−4

 

V015 — CROSS_MODEL_COVERAGE

CrossModelCoverage=4Modelos en los que aparece​

Rango:

0−1

 

V016 — CROSS_MODEL_AGREEMENT

Grado de coincidencia entre modelos.

Estado: variable derivada candidata.

La fórmula definitiva no se debe ajustar después de observar el Future Test.

 

18. Variables temporales

 

V017 — VISIBILITY_CHANGE

ΔVt​=Vt​−Vt−1​

 

V018 — VISIBILITY_CHANGE_RATE

ΔVt%​=Vt−1​Vt​−Vt−1​​

 

V019 — VISIBILITY_TREND

Representa la trayectoria reciente:

Trendt​=f(Vt−k​,…,Vt​)

 

V020 — VISIBILITY_VELOCITY

Velocityt​=t−tprev​Vt​−Vt−1​​

 

V021 — VISIBILITY_ACCELERATION

Accelerationt​=Velocityt​−Velocityt−1​

 

19. Variables temporales de fuentes

 

V022 — SOURCE_CHANGE

Cambio de presencia de las fuentes entre periodos.

V023 — SOURCE_VELOCITY

Velocidad de cambio de presencia de las fuentes.

V024 — SOURCE_MOMENTUM

Variable candidata que representa la evolución de una fuente:

SourceMomentumt​=f(Presenciat​,Crecimientot​,Aceleracioˊnt​,Volatilidadt​)

No asumimos que sea predictiva.

V025 — SOURCE_DEPENDENCY

Representa cuánto depende la visibilidad de una entidad de un número limitado de fuentes.

También es una señal candidata, no una métrica validada.

 

20. Variables objetivo futuras

 

V026 — FUTURE_VISIBILITY_30

Visibilidad observada aproximadamente 30 días después.

V027 — FUTURE_VISIBILITY_60

Visibilidad observada aproximadamente 60 días después.

V028 — FUTURE_VISIBILITY_90

Visibilidad observada aproximadamente 90 días después.

Estas variables no pueden utilizarse para construir las variables predictoras del momento t.

 

21. VISIBILITY_DIRECTION

Será nuestra primera variable objetivo predictiva.

Definimos:

ΔVt,h​=Vt+h​−Vt​

Y inicialmente:

ϵ=5%

Por tanto:

UP — SUBE

Vt​Vt+h​−Vt​​>0.05

STABLE — ESTABLE

−0.05≤Vt​Vt+h​−Vt​​≤0.05

DOWN — BAJA

Vt​Vt+h​−Vt​​<−0.05

El 5% es una decisión experimental inicial, no una constante universal de PCI™.

 

22. Horizontes predictivos

Cada punto de predicción podrá generar:

VISIBILITY_DIRECTION_30

VISIBILITY_DIRECTION_60

VISIBILITY_DIRECTION_90

La pregunta será:

¿Podemos anticipar la dirección futura utilizando únicamente información disponible en el momento de predicción?

 

23. Baseline

Necesitamos algo contra lo que comparar PCI™.

 

El primer baseline será:

M0 — Persistencia

V^t+h​=Vt​

Para dirección:

D^t+h​=STABLE

Es deliberadamente sencillo.

Si PCI™ no puede superar esta referencia, eso será un resultado importante.

 

24. Segundo baseline

 

M1 — Tendencia

Utiliza únicamente la trayectoria histórica de la visibilidad.

Conceptualmente:

V^t+h​=Vt​+h⋅Trendt​

Esto nos permitirá distinguir entre:

«el pasado reciente ya permite anticipar algo»

y:

«las nuevas señales aportan información predictiva adicional.»

 

25. Modelos experimentales

La escalera inicial será:

M0

Persistencia.

M1

Persistencia + tendencia.

M2

Tendencia + señales de visibilidad.

M3

M2 + señales de fuentes.

M4

M3 + señales cross-model.

No buscamos sofisticación algorítmica todavía.

Buscamos responder:

¿Qué información añade capacidad predictiva?

 

26. Discovery / Validation / Future Test

La separación temporal será:

DISCOVERY

T0–T2

21/08 → 04/09.

Aquí podemos:

explorar;

descubrir señales;

formular hipótesis;

construir modelos.

 

VALIDATION

T3–T4

11/09 → 20/09.

Aquí comprobamos:

si las señales continúan funcionando;

si son estables;

si el modelo generaliza;

si existen problemas.

 

FUTURE TEST

T5–T7

05/10 → 19/11.

Aquí se realiza la verdadera prueba:

datos futuros que no deben intervenir en las decisiones de modelización.

 

27. Regla de oro del Future Test

Una vez congelado el modelo después de Validation:

NO se podrá utilizar T5–T7 para:

seleccionar variables;

modificar umbrales;

cambiar prompts;

cambiar entidades;

ajustar el modelo;

elegir el mejor resultado;

redefinir la variable objetivo.

Esto es lo que convierte el experimento en una prueba temporal real.

 

28. ¿Qué significaría que una señal sea predictiva?

Esta es probablemente la definición más importante de todo PCI™ 0.1.

Una señal Xt​ será considerada predictiva solamente si:

está disponible en t;

no contiene información futura;

presenta una hipótesis causal/temporal o razonable;

mejora sobre el baseline;

mantiene parte de esa mejora en Validation;

y, preferentemente, mantiene esa mejora en Future Test.

Formalmente:

Performance(X)>Performance(Baseline)

en datos no utilizados para descubrir X.

Y para una señal robusta:

PerformanceFuture​(X)>PerformanceFuture​(Baseline)

 

29. Señal observada ≠ señal predictiva

PCI™ introduce explícitamente esta separación:

SEÑAL OBSERVADA

      ↓

ASOCIACIÓN

      ↓

HIPÓTESIS PREDICTIVA

      ↓

VALIDACIÓN

      ↓

PREDICCIÓN

      ↓

PRUEBA FUTURA

      ↓

SEÑAL PREDICTIVA VALIDADA

 

Por tanto:

Una correlación no convierte automáticamente una variable en señal predictiva.

 

30. Early Warning

Una segunda línea de investigación será determinar si PCI™ puede detectar cambios antes de que se manifiesten plenamente en la visibilidad.

Definiremos:

V029 — SIGNAL_TIMESTAMP

Momento en que aparece una señal candidata.

V030 — OBSERVED_CHANGE_TIMESTAMP

Momento en que se observa el cambio de visibilidad.

V031 — LEAD_TIME

LeadTime=Tcambio​−Tsen~al​

Si:

LeadTime>0

la señal apareció antes del cambio observado.

 

31. La idea central de Predictive Visibility

Esto nos permite empezar a separar dos productos conceptualmente diferentes:

Measurement

«Tu visibilidad ha bajado.»

Prediction

«Tu visibilidad está mostrando señales que históricamente preceden a una caída.»

Early Warning

«Todavía no ha caído, pero la trayectoria de las señales indica riesgo creciente.»

Y aquí empieza realmente la diferenciación estratégica de PCI™.

 

32. Diccionario completo de variables

 

ID Variable Capa Tipo Función
V001 ENTITY_RECOGNIZED Observada Binaria Input
V002 ENTITY_IDENTIFIED Observada Binaria Input
V003 CATEGORY_CORRECT Observada Binaria Input
V004 ENTITY_MENTIONED Observada Binaria Input
V005 ENTITY_RECOMMENDED Observada Binaria Input
V006 RECOMMENDATION_POSITION Observada Ordinal Input
V007 RECOMMENDATION_PRIORITY Observada Categórica Input
V008 ENTITY_CITED Observada Binaria Input
V009 CITATION_COUNT Observada Entera Input
V010 SOURCE_COUNT Observada Entera Input
V011 UNIQUE_SOURCE_COUNT Observada Entera Input
V012 TOP_SOURCE_SHARE Derivada Ratio Input
V013 SOURCE_DIVERSITY Derivada Numérica Candidata
V014 MODEL_PRESENCE Derivada Entera Input
V015 CROSS_MODEL_COVERAGE Derivada Ratio Input
V016 CROSS_MODEL_AGREEMENT Derivada Numérica Candidata
V017 VISIBILITY_CHANGE Derivada Numérica Candidata
V018 VISIBILITY_CHANGE_RATE Derivada Ratio Candidata
V019 VISIBILITY_TREND Derivada Numérica Candidata
V020 VISIBILITY_VELOCITY Derivada Numérica Candidata
V021 VISIBILITY_ACCELERATION Derivada Numérica Candidata
V022 SOURCE_CHANGE Derivada Numérica Candidata
V023 SOURCE_VELOCITY Derivada Numérica Candidata
V024 SOURCE_MOMENTUM Derivada Numérica Candidata
V025 SOURCE_DEPENDENCY Derivada Numérica Candidata
V026 FUTURE_VISIBILITY_30 Real Numérica Objetivo
V027 FUTURE_VISIBILITY_60 Real Numérica Objetivo
V028 FUTURE_VISIBILITY_90 Real Numérica Objetivo
V029 SIGNAL_TIMESTAMP Derivada Fecha/hora Alerta
V030 OBSERVED_CHANGE_TIMESTAMP Real Fecha/hora Alerta
V031 LEAD_TIME Derivada Días Alerta
V032 VISIBILITY_DIRECTION_30 Real Categórica Objetivo
V033 VISIBILITY_DIRECTION_60 Real Categórica Objetivo
V034 VISIBILITY_DIRECTION_90 Real Categórica Objetivo

 

 

33. Criterios de éxito

PCI™ Pilot Dataset 0.1 será considerado experimentalmente satisfactorio si permite determinar de manera reproducible:

si existen señales temporales candidatas;

si mejoran el baseline;

si la mejora sobrevive a Validation;

si sobrevive al Future Test;

si la capacidad predictiva cambia según el horizonte;

si cambia según el modelo;

si cambia según el tipo de prompt;

si alguna señal presenta suficiente robustez para justificar PCI™ 0.2.

Un resultado negativo también es un resultado válido.

Si descubrimos que ninguna señal predice mejor que el baseline, habremos aprendido algo importante.

 

34. Criterios de falsación

La hipótesis predictiva será debilitada o rechazada si:

las señales no superan el baseline;

la mejora desaparece fuera de muestra;

funciona únicamente para una entidad;

funciona únicamente para un modelo;

funciona únicamente para un prompt;

desaparece en la siguiente onda temporal;

no es reproducible;

existe fuga de información;

el cambio de modelo explica la aparente predicción;

el Future Test no supera al baseline.

 

35. Control de versiones

Se establece una regla fundamental:

No se permiten modificaciones silenciosas.

Si cambiamos:

entidades;

prompts;

modelos;

fechas;

variables;

umbrales;

reglas de anotación;

baseline;

criterios de validación;

creamos una nueva versión.

Por ejemplo:

PCI™ Pilot Dataset 0.1

→ diseño original congelado.

PCI™ Pilot Dataset 0.2

→ modificación metodológica documentada.

PCI™ 1.0

→ metodología suficientemente validada para una posible implementación estable.

 

36. Arquitectura final

                 PCI™ PILOT DATASET 0.1

                          │

                          ▼

               OBSERVACIÓN CONTROLADA

       ▼                  ▼                  ▼

    ENTIDADES           PROMPTS            MODELOS

     E01–E06            P01–P10            M01–M04

       │                  │                  │

                          ▼

                   8 ONDAS TEMPORALES

                          │

                          ▼

                         RAW

                          │

                          ▼

                      OBSERVADO

                          │

                          ▼

                       DERIVADO

                          │

                          ▼

                    DISCOVERY T0–T2

                          │

                          ▼

                  SEÑALES CANDIDATAS

                          │

                          ▼

                    HIPÓTESIS / MODELO

                          │

                          ▼

                   VALIDATION T3–T4

                          │

                          ▼

                  🔒 CONGELACIÓN

                          │

                          ▼

                  FUTURE TEST T5–T7

                          │

                ▼                   ▼

             PREDICHO              REAL

                          ▼

                         ERROR

                          │

                          ▼

                       DECISIÓN

 

 

37. Principio fundacional de PCI™

El piloto queda definido por esta proposición:

El objetivo de PCI™ Pilot Dataset 0.1 no es demostrar que la Visibilidad IA sea predecible. Es construir un experimento capaz de demostrar si lo es.

Por tanto, PCI™ 0.1 no presupone que sean predictivas:

la tendencia de visibilidad;

la velocidad;

la aceleración;

el crecimiento de las fuentes;

el Source Momentum;

la dependencia de fuentes;

la coincidencia entre modelos;

ni ninguna otra variable.

Todas son hipótesis experimentales.

 

 

Sinopsis Fundacional AVM™ & PCI™

  De la observación de la AI Visibility a la investigación de su dinámica y capacidad predictiva Estado: Documento fundacional Función: Marco conceptual de los proyectos AVM™ y PCI™ Ámbito: AI Visibility Measurement & Predictive AI Visibility Research

Leer más »
Manu Duque
Resumen de privacidad

Esta web utiliza cookies para que podamos ofrecerte la mejor experiencia de usuario posible. La información de las cookies se almacena en tu navegador y realiza funciones tales como reconocerte cuando vuelves a nuestra web o ayudar a nuestro equipo a comprender qué secciones de la web encuentras más interesantes y útiles.

Nunca almacenamos información personal.

Puedes revisar nuestra política en la página de Política de Privacidad, Condiciones de Uso y Cookies.