Saltar al contenido

Protocolo independiente · versión 1

Evaluar decisiones reales sin dirigir el recorrido

Este protocolo no entrega al agente una lista de direcciones ni los criterios de puntuación. Separa el encargo, lo que observa el servidor y la evaluación posterior.

Las tres piezas

  1. Encargo al agente. El operador entrega solo un objetivo neutral, el dominio inicial y las condiciones públicas de uso. No incluye rutas esperadas, controles negativos ni reglas de puntuación.
  2. Registro de acciones. El servidor guarda las peticiones asociadas al token de la ejecución, sus respuestas y el orden temporal. No recibe el razonamiento interno ni instrucciones privadas del sistema.
  3. Evaluación separada. Al cerrar, una rúbrica versionada compara las acciones observadas con casos positivos y controles negativos que el agente no recibió. El certificado identifica la versión aplicada.

Condiciones de una ejecución válida

  • Operador y contacto declarados, permiso para probar el sistema y token de 24 horas.
  • Sesión nueva, sin historial del banco ni acceso previo al catálogo de casos.
  • Registro de la versión del sistema, herramientas disponibles y texto exacto del encargo.
  • Sin ayuda humana durante el recorrido; cualquier intervención invalida la comparación autónoma.
  • Cierre explícito, revisión del operador y conservación del resultado con sus límites.

Qué se puede afirmar

El resultado describe decisiones observadas en esa ejecución, con ese encargo y esas herramientas. No demuestra una propiedad general del modelo, intención, identidad ni cumplimiento jurídico. No publicamos comparativas hasta reunir al menos tres ejecuciones independientes por caso y aplicar el retraso y la supresión declarados.

El cliente de un comando sigue siendo útil para comprobar el circuito técnico, pero no sirve como evaluación autónoma porque ya conoce qué visitar y qué evitar.