Zum Inhalt springen
Alle Bibliotheksdokumente

Evidenzbasierte Prüfungen modularer Trading-Agenten

Artikel arXiv papers · Autor: Ali Atiah Alzahrani

Zusammenfassung

Dieses Paper schlägt eine Prüfung auf Ebene einzelner Aussagen für modulare Agenten vor, die planen, handeln, prüfen und verbessern. Anlass sind die Grenzen eines einzelnen aggregierten Aufgabenwerts. Die Prüfung dokumentiert die Evidenz zu jeder Schlussfolgerung, ordnet sie als gestützt, nicht gestützt, ungeklärt oder nicht bewertet ein und nennt den Geltungsbereich der Schlussfolgerung. Sie soll verdeutlichen, was eine Evaluierung über einen Agenten und seine Komponenten tatsächlich belegt.

Drei Methoden liefern Evidenz: Orakelrichtlinien messen die erreichbare Verbesserung für eine festgelegte Aktionsmenge; der schrittweise Austausch durch eine ideale Komponente hilft, Wertverluste zu lokalisieren, wobei nachgelagerte Maskierung berücksichtigt wird; und ein separater Test prüft, ob der Wert eines Verifizierers tatsächlich die ihm zugeschriebene Schranke stützt. In einem synthetischen Markt mit verborgenen Regimen stellt die Prüfung fest, dass der gemessene Wert perfekter Regimeinformationen je nach Aktionsmenge variiert, ein Szenariogenerator einen Großteil des Regimesignals verliert und ein zur Laufzeit eingesetzter Verifizierer umgangen werden kann, ohne dass sich die sichtbaren Ergebnisse ändern. Diese Befunde betreffen einen Agenten und eine Umgebung; der Prüfablauf ist der allgemeinere Beitrag.

Kernaussagen

  • Aggregierte Aufgabenwerte allein zeigen möglicherweise nicht, welche Komponente ein Ergebnis verursacht oder was ein Verifizierer bestätigt.
  • Die Prüfung ordnet jeder Aussage Evidenz, ein vierstufiges Urteil und einen Geltungsbereich zu.
  • Orakelrichtlinien schätzen erreichbare Verbesserungen im Verhältnis zu einer ausdrücklich festgelegten Aktionsmenge.
  • Der Austausch von Komponenten kann Wertverluste lokalisieren, doch nachgelagerte Effekte können Ergebnisse ungeklärt lassen.
  • Die Befunde im synthetischen Markt beziehen sich speziell auf den untersuchten Agenten und die untersuchte Umgebung.

Schlagwörter

Volltext
# Verify Claims, Not Scores: Evidence-Based Verification of Modular Agents


# Verify Claims, Not Scores: Evidence-Based Verification of Modular Agents









When developers change one component of an agent, such as its controller, a learned model or its verifier, they usually judge the change by an aggregate task score. That score cannot tell whether improvement was attainable, which component lost value, or what the agent's own checks certify. We introduce a claim-specific verification audit for modular agents that plan, act, check and refine. Instead of scoring the agent, the audit scores the evidence: each conclusion is recorded with the evidence behind it, one of four verdicts (supported, unsupported, unresolved or not evaluated) and the boundary within which it holds. Three tools supply that evidence. Oracle policies measure attainable improvement under an explicitly stated action set, so that a low value can be traced to the evaluation rather than to the environment. Replacing one component at a time with a perfect counterpart locates lost value, with null results read as unresolved whenever a downstream component could mask them. A separate test asks whether the verifier's score identifies the quantity it is read as bounding. Applied to a constrained portfolio-allocation agent in a synthetic market with known hidden regimes, the audit shows that the value of perfect regime information depends on the action set used to measure it, that the scenario generator discards most of the regime signal while better local fidelity does not improve decisions, and that the runtime verifier can be bypassed with no visible change in outcomes. The contribution is the protocol and the evidential distinctions it enforces; the empirical findings are specific to the agent and environment studied.

Vollständig mit Quellenangabe unter der Lizenz der Quelle angezeigt. Lizenz: abstract CC0

Diese Zusammenfassung wurde vom Research-Agenten von Stratmill anhand des Originals verfasst; sie ist keine Kopie der Quelle.