Metodología · reglas versión 2
Qué medimos y qué podemos afirmar
Este estudio separa dos cosas que suelen mezclarse: lo que se observa y lo que se infiere de lo observado. Con telemetría web pasiva no se puede distinguir de forma fiable a una persona, un rastreador y un agente autónomo, así que registramos dimensiones observables y aceptamos «indeterminado» como resultado válido, no como fallo.
Diccionario de eventos
Un mismo acceso puede generar varios eventos. No se suman como «visitas»: cada tipo se cuenta por separado y con su propio denominador.
| Evento | Qué significa |
|---|---|
| peticion_servidor | El servidor recibió y respondió una petición de una página. |
| navegacion_spa | Cambio de página sin recargar, dentro de una visita ya abierta. |
| beacon_js | Se ejecutó código de navegador y llegó su aviso. Es un evento propio, no una visita. |
| ruta_canario | Se pidió una de las rutas únicas mencionadas en el texto de una ficha. |
| correo_entrante | El proveedor de correo aceptó un mensaje en una dirección única de ficha. |
| recurso_maquina | Se pidió una representación pensada para máquinas: JSON, Markdown, feed o llms.txt. |
Seis dimensiones por sesión
| Dimensión | Valores | Qué permite afirmar |
|---|---|---|
| Identidad declarada | buscador · herramienta · navegador · desconocido | Solo lo que la petición dice de sí misma. Es falsificable. |
| Verificación técnica | operador verificado · no verificado | Comprobación de DNS inverso y directo cuando el operador publica el procedimiento. Indica procedencia de infraestructura, no finalidad. |
| Mecanismo observado | HTTP sin beacon · ejecución JS · endpoint estructurado · mixto | Cómo se accedió. No dice quién accedió. |
| Patrón de acceso | enumeración · consulta puntual · seguimiento de referencias · insuficiente | Comportamiento compatible con varias causas distintas. |
| Procedencia | externo · ejecución controlada · monitor · propio · desconocida | Solo en ejecución controlada existe verdad de referencia. |
| Evidencia de agencia | conocida en experimento · compatible · insuficiente | Fuerza de la inferencia, separada de la inferencia misma. |
El resumen categórico (persona, rastreador, agente, indeterminado) se conserva como etiqueta secundaria derivada de estas dimensiones. Las puntuaciones de reglas no son probabilidades mientras no estén calibradas contra ejecuciones conocidas.
Matriz de afirmaciones permitidas
| Afirmación | Cuándo se permite | Qué no permite concluir |
|---|---|---|
| Se pidió esta ruta única | Sí, es un hecho registrado. | No dice que fuera un sistema automático ni que desobedeciera nada. |
| Se aceptó un mensaje en esta dirección | Sí, es un hecho del proveedor de correo. | No prueba envío autónomo ni falta de autorización de la persona usuaria. |
| Aparece este código de referencia en una salida | Solo si observamos esa salida legítimamente. | No prueba que el modelo visitara el sitio. |
| Se observó un beacon JS | Sí, se ejecutó código de navegador. | No significa persona: la automatización de navegador también lo ejecuta. |
| Este operador cumplió las reglas de rastreo | Solo dentro de un experimento controlado y publicando la interpretación aplicada. | robots.txt no es control de acceso ni una licencia general. |
Agrupación de eventos
Los eventos se agrupan por un identificador técnico derivado del agente declarado, el idioma y la familia aproximada de red, firmado con una clave que solo conoce el servidor. Una agrupación se cierra cuando pasan 30 minutos sin ningún evento (cada petición cuenta como un evento propio: no fusionamos peticiones distintas por caer en la misma franja de tiempo), y el siguiente evento abre una nueva: no usamos bloques fijos de reloj, que partían por la mitad una lectura en curso. Las ejecuciones controladas se agrupan aparte del tráfico externo. No es una identidad de visitante y no lo llamamos «usuarios únicos»: puede juntar accesos de personas distintas y partir accesos del mismo actor.
Reglas evaluables y controles negativos
Contar visitas no dice nada sobre conducta. Para poder decir algo, publicamos reglas explícitas y comprobables: una ruta excluida en robots.txt sin contenido de valor (/zona-excluida), una pareja permitida con el mismo texto (/zona-abierta), un límite de peticiones declarado y respuestas 429 con tiempo de espera. La pareja permitida es el control negativo: sin ella, una petición a la ruta excluida sería indistinguible del recorrido normal del sitio.
De cada comparación solo afirmamos si la regla se aplicó en esa agrupación de eventos, con tres resultados posibles: solo la abierta, ambas, o solo la excluida. Hay explicaciones legítimas para no aplicarla —un enlace abierto a mano, una lista guardada de antes, una caché intermedia—, así que no la tratamos como infracción, ni la asociamos a una identidad, ni la convertimos en una tasa de cumplimiento por operador. Las cifras públicas de estas rutas siguen las mismas reglas de supresión y retraso que el resto.
Confianza y verdad de referencia
Una sesión solo alcanza confianza alta cuando procede de una ejecución controlada registrada en el banco de pruebas y la persona responsable confirma después que esa ejecución se realizó tal como estaba descrita. Un enlace con token no basta por sí solo: los tokens son largos y aleatorios, caducan, se pueden revocar y, mientras no haya confirmación, la sesión se queda en confianza media. El token se declara en la cabecera X-Observatorio-Ejecuciono en el parámetro ejecucion, y vale igual para páginas, formatos legibles por máquina y activaciones de señuelo, de modo que una prueba propia no se cuela en el tráfico externo. El tipo de sistema declarado se elige de una lista cerrada y solo los tipos de agente, y solo confirmados, cuentan como evidencia de agencia conocida. El tráfico externo llega, como máximo, a confianza media, y sus resultados se publican por separado de los controlados.
Límites conocidos
- Cada exposición de un señuelo lleva un código propio, así que una activación se atribuye a la entrega concreta que la originó; cuando llega sin ese código, la atribución sigue siendo tentativa.
- Que una entrega y una activación caigan en la misma agrupación no prueba que sea el mismo actor: solo que comparten rasgos técnicos.
- Una respuesta servida desde caché puede no llegar a registrarse. Prefetch, reintentos y peticiones HEAD generan actividad sin lectura.
- La ausencia de beacon no significa ausencia de navegador.
- Los avisos del navegador y los endpoints públicos son falsificables: no se tratan como prueba fuerte.
- El servidor no ve las respuestas que un modelo genera fuera del sitio, así que el código de referencia solo se observa en pruebas propias o aportaciones consentidas.
Qué no hacemos
- No incluimos instrucciones ocultas ni dirigidas a sistemas automáticos: eso convertiría una observación en una intervención.
- No servimos contenido distinto según quién pregunte.
- No publicamos que un operador concreto «incumplió» nada a partir de un agente declarado, un beacon o una activación de correo.
- No compramos tráfico ni generamos páginas para posicionar.
Correcciones
Las reglas están versionadas y el histórico se recalcula cuando cambian. Cualquier error se corrige aquí, con fecha y motivo, antes de sostener nada en público.
- Reglas v2 — se sustituye la clasificación excluyente por seis dimensiones observables, se separan los tipos de evento, se limita la confianza alta a ejecuciones controladas y se pasa la retención a capas de 72 horas, 90 días y 180 días.
- Reglas v1 — clasificación única por sesión. Retirada: mezclaba identidad, mecanismo e intención.
Los resultados están en el observatorio, el tratamiento de datos en el aviso y las condiciones de lectura automatizada en acceso automatizado.