Auditorías basadas en evidencia para agentes de trading modulares
Resumen
Este artículo propone una auditoría de afirmaciones para agentes modulares que planifican, actúan, comprueban y refinan, motivada por los límites de depender de una única puntuación agregada de tarea. La auditoría registra la evidencia de cada conclusión, asigna un veredicto de respaldada, no respaldada, sin resolver o no evaluada, y especifica el ámbito en que se aplica la conclusión. Su propósito es aclarar qué demuestra una evaluación sobre un agente y sus componentes.
Tres métodos aportan evidencia: las políticas oráculo miden la mejora alcanzable para un conjunto de acciones especificado; la sustitución de un componente cada vez por uno ideal ayuda a localizar el valor perdido, aunque permite que los efectos posteriores lo oculten; y una prueba aparte comprueba si la puntuación de un verificador respalda realmente el límite que se le atribuye. En un mercado sintético con regímenes ocultos, la auditoría observa que el valor medido de la información perfecta sobre el régimen varía según el conjunto de acciones, que un generador de escenarios pierde gran parte de la señal del régimen y que se puede eludir un verificador en tiempo de ejecución sin cambios visibles en los resultados. Estos hallazgos se refieren a un agente y entorno concretos; la contribución más amplia es el protocolo.
Ideas clave
- Las puntuaciones agregadas de tareas por sí solas quizá no identifiquen qué componente causó un resultado ni qué certifica un verificador.
- La auditoría asocia cada afirmación con evidencia, un veredicto de cuatro opciones y un límite de alcance.
- Las políticas oráculo estiman las ganancias alcanzables en relación con un conjunto de acciones definido explícitamente.
- La sustitución de componentes puede localizar el valor perdido, pero los efectos posteriores pueden dejar los hallazgos sin resolver.
- Los hallazgos del mercado sintético corresponden específicamente al agente y entorno estudiados.
Etiquetas
Texto completo
# Verify Claims, Not Scores: Evidence-Based Verification of Modular Agents # Verify Claims, Not Scores: Evidence-Based Verification of Modular Agents When developers change one component of an agent, such as its controller, a learned model or its verifier, they usually judge the change by an aggregate task score. That score cannot tell whether improvement was attainable, which component lost value, or what the agent's own checks certify. We introduce a claim-specific verification audit for modular agents that plan, act, check and refine. Instead of scoring the agent, the audit scores the evidence: each conclusion is recorded with the evidence behind it, one of four verdicts (supported, unsupported, unresolved or not evaluated) and the boundary within which it holds. Three tools supply that evidence. Oracle policies measure attainable improvement under an explicitly stated action set, so that a low value can be traced to the evaluation rather than to the environment. Replacing one component at a time with a perfect counterpart locates lost value, with null results read as unresolved whenever a downstream component could mask them. A separate test asks whether the verifier's score identifies the quantity it is read as bounding. Applied to a constrained portfolio-allocation agent in a synthetic market with known hidden regimes, the audit shows that the value of perfect regime information depends on the action set used to measure it, that the scenario generator discards most of the regime signal while better local fidelity does not improve decisions, and that the runtime verifier can be bypassed with no visible change in outcomes. The contribution is the protocol and the evidential distinctions it enforces; the empirical findings are specific to the agent and environment studied.
Se muestra íntegramente con atribución según la licencia de la fuente. Licencia: abstract CC0
Este resumen lo redactó el agente de investigación de Stratmill a partir del original; no es una copia de la fuente.