Перейти к содержимому
Все документы библиотеки

Проверка модульных торговых агентов на основе доказательств

Статья arXiv papers · Автор: Ali Atiah Alzahrani

Сводка

В статье предлагается аудит отдельных утверждений о модульных агентах, которые планируют, действуют, проверяют результат и дорабатывают его. Предложение вызвано ограниченностью единой общей оценки задачи. Для каждого вывода аудит фиксирует доказательства, присваивает вердикт «подтверждено», «не подтверждено», «не определено» или «не оценивалось» и указывает границы применимости вывода. Цель — прояснить, что именно оценка устанавливает об агенте и его компонентах.

Доказательства получают тремя методами: оракульные политики измеряют достижимое улучшение для заданного набора действий; поочередная замена компонента на идеальный помогает обнаружить потерянную ценность с учетом возможности ее маскировки последующими этапами; отдельный тест проверяет, действительно ли оценка верификатора подтверждает приписываемую ей границу. В синтетическом рынке со скрытыми режимами проверка показывает, что измеренная ценность полной информации о режиме зависит от набора действий, генератор сценариев утрачивает значительную часть сигнала о режиме, а работающий во время исполнения верификатор можно обойти без видимого изменения результата. Эти выводы относятся к одному агенту и одной среде; более общий вклад статьи — протокол проверки.

Ключевые идеи

  • Одни лишь общие оценки задачи могут не показать, какой компонент вызвал результат и что именно удостоверяет верификатор.
  • Для каждого утверждения проверка указывает доказательства, один из четырех вердиктов и границы применимости.
  • Оракульные политики оценивают достижимый выигрыш относительно явно заданного набора действий.
  • Замена компонентов может выявить потерю ценности, но влияние последующих этапов может оставить выводы неразрешенными.
  • Выводы о синтетическом рынке относятся только к изученному агенту и среде.

Теги

Полный текст
# Verify Claims, Not Scores: Evidence-Based Verification of Modular Agents


# Verify Claims, Not Scores: Evidence-Based Verification of Modular Agents









When developers change one component of an agent, such as its controller, a learned model or its verifier, they usually judge the change by an aggregate task score. That score cannot tell whether improvement was attainable, which component lost value, or what the agent's own checks certify. We introduce a claim-specific verification audit for modular agents that plan, act, check and refine. Instead of scoring the agent, the audit scores the evidence: each conclusion is recorded with the evidence behind it, one of four verdicts (supported, unsupported, unresolved or not evaluated) and the boundary within which it holds. Three tools supply that evidence. Oracle policies measure attainable improvement under an explicitly stated action set, so that a low value can be traced to the evaluation rather than to the environment. Replacing one component at a time with a perfect counterpart locates lost value, with null results read as unresolved whenever a downstream component could mask them. A separate test asks whether the verifier's score identifies the quantity it is read as bounding. Applied to a constrained portfolio-allocation agent in a synthetic market with known hidden regimes, the audit shows that the value of perfect regime information depends on the action set used to measure it, that the scenario generator discards most of the regime signal while better local fidelity does not improve decisions, and that the runtime verifier can be bypassed with no visible change in outcomes. The contribution is the protocol and the evidential distinctions it enforces; the empirical findings are specific to the agent and environment studied.

Полный текст с указанием источника опубликован на условиях его лицензии. Лицензия: abstract CC0

Это краткое изложение подготовлено исследовательским агентом Stratmill по оригиналу и не является его копией.