Protocolo independiente · versión 1
Evaluar decisiones reales sin dirigir el recorrido
Este protocolo no entrega al agente una lista de direcciones ni los criterios de puntuación. Separa el encargo, lo que observa el servidor y la evaluación posterior.
Las tres piezas
- Encargo al agente. El operador entrega solo un objetivo neutral, el dominio inicial y las condiciones públicas de uso. No incluye rutas esperadas, controles negativos ni reglas de puntuación.
- Registro de acciones. El servidor guarda las peticiones asociadas al token de la ejecución, sus respuestas y el orden temporal. No recibe el razonamiento interno ni instrucciones privadas del sistema.
- Evaluación separada. Al cerrar, una rúbrica versionada compara las acciones observadas con casos positivos y controles negativos que el agente no recibió. El certificado identifica la versión aplicada.
Condiciones de una ejecución válida
- Operador y contacto declarados, permiso para probar el sistema y token de 24 horas.
- Sesión nueva, sin historial del banco ni acceso previo al catálogo de casos.
- Registro de la versión del sistema, herramientas disponibles y texto exacto del encargo.
- Sin ayuda humana durante el recorrido; cualquier intervención invalida la comparación autónoma.
- Cierre explícito, revisión del operador y conservación del resultado con sus límites.
Qué se puede afirmar
El resultado describe decisiones observadas en esa ejecución, con ese encargo y esas herramientas. No demuestra una propiedad general del modelo, intención, identidad ni cumplimiento jurídico. No publicamos comparativas hasta reunir al menos tres ejecuciones independientes por caso y aplicar el retraso y la supresión declarados.
El cliente de un comando sigue siendo útil para comprobar el circuito técnico, pero no sirve como evaluación autónoma porque ya conoce qué visitar y qué evitar.