Audits fondés sur des preuves pour les agents de trading modulaires
Résumé
Cet article propose un audit au niveau des affirmations pour les agents modulaires qui planifient, agissent, vérifient et améliorent leurs résultats, en réponse aux limites d’un score agrégé unique. L’audit consigne les preuves de chaque conclusion, attribue l’un des verdicts suivants : étayé, non étayé, non résolu ou non évalué, et précise le périmètre dans lequel la conclusion s’applique. Il vise à clarifier ce qu’une évaluation établit au sujet d’un agent et de ses composants.
Trois méthodes apportent des éléments : les politiques oracle mesurent l’amélioration possible pour un ensemble d’actions défini ; le remplacement, un composant à la fois, par un composant idéal aide à repérer la perte de valeur, tout en tenant compte d’éventuels effets de masquage en aval ; enfin, un test distinct vérifie si le score d’un vérificateur étaye réellement la borne qui lui est attribuée. Dans un marché synthétique à régimes cachés, l’audit constate que la valeur mesurée d’une information parfaite sur le régime varie selon l’ensemble d’actions, qu’un générateur de scénarios perd une grande partie du signal de régime et qu’un vérificateur en cours d’exécution peut être contourné sans changement visible des résultats. Ces constats portent sur un agent et un environnement ; le protocole constitue la contribution plus générale.
Idées clés
- Les scores agrégés d’une tâche ne suffisent pas toujours à identifier le composant à l’origine d’un résultat ni ce que certifie un vérificateur.
- L’audit associe à chaque affirmation les preuves, un verdict à quatre possibilités et les limites de portée.
- Les politiques oracle estiment les gains possibles par rapport à un ensemble d’actions défini explicitement.
- Le remplacement d’un composant peut repérer une perte de valeur, mais les effets en aval peuvent laisser les conclusions non résolues.
- Les résultats sur le marché synthétique sont propres à l’agent et à l’environnement étudiés.
Étiquettes
Texte intégral
# Verify Claims, Not Scores: Evidence-Based Verification of Modular Agents # Verify Claims, Not Scores: Evidence-Based Verification of Modular Agents When developers change one component of an agent, such as its controller, a learned model or its verifier, they usually judge the change by an aggregate task score. That score cannot tell whether improvement was attainable, which component lost value, or what the agent's own checks certify. We introduce a claim-specific verification audit for modular agents that plan, act, check and refine. Instead of scoring the agent, the audit scores the evidence: each conclusion is recorded with the evidence behind it, one of four verdicts (supported, unsupported, unresolved or not evaluated) and the boundary within which it holds. Three tools supply that evidence. Oracle policies measure attainable improvement under an explicitly stated action set, so that a low value can be traced to the evaluation rather than to the environment. Replacing one component at a time with a perfect counterpart locates lost value, with null results read as unresolved whenever a downstream component could mask them. A separate test asks whether the verifier's score identifies the quantity it is read as bounding. Applied to a constrained portfolio-allocation agent in a synthetic market with known hidden regimes, the audit shows that the value of perfect regime information depends on the action set used to measure it, that the scenario generator discards most of the regime signal while better local fidelity does not improve decisions, and that the runtime verifier can be bypassed with no visible change in outcomes. The contribution is the protocol and the evidential distinctions it enforces; the empirical findings are specific to the agent and environment studied.
Reproduit dans son intégralité avec attribution, conformément à la licence de la source. Licence: abstract CC0
Ce résumé a été rédigé par l’agent de recherche de Stratmill à partir de la source originale ; il n’en est pas une copie.