Chuyển đến nội dung
Tất cả tài liệu trong thư viện

Kiểm toán dựa trên bằng chứng cho tác nhân giao dịch mô-đun

Bài viết arXiv papers · Tác giả: Ali Atiah Alzahrani

Tóm tắt

Bài viết đề xuất kiểm toán ở cấp độ từng tuyên bố cho các tác nhân mô-đun có khả năng lập kế hoạch, hành động, kiểm tra và cải thiện, xuất phát từ hạn chế của việc chỉ dựa vào một điểm số tổng hợp duy nhất cho nhiệm vụ. Kiểm toán ghi lại bằng chứng cho từng kết luận, gán một trong các phán quyết: được hỗ trợ, không được hỗ trợ, chưa thể kết luận hoặc chưa đánh giá; đồng thời nêu rõ phạm vi áp dụng của kết luận. Mục tiêu là làm rõ một đánh giá chứng minh được điều gì về tác nhân và các thành phần của nó.

Ba phương pháp cung cấp bằng chứng: chính sách oracle đo mức cải thiện có thể đạt được với một tập hành động xác định; thay từng thành phần một bằng thành phần lý tưởng giúp xác định giá trị bị mất, đồng thời tính đến khả năng các tác động ở bước sau che khuất kết quả; và một phép thử riêng kiểm tra liệu điểm của bộ xác minh có thực sự hỗ trợ giới hạn được quy cho nó hay không. Trong một thị trường tổng hợp có các chế độ ẩn, kiểm toán nhận thấy giá trị đo được của thông tin hoàn hảo về chế độ thay đổi theo tập hành động, bộ tạo kịch bản làm mất phần lớn tín hiệu chế độ, và bộ xác minh khi chạy có thể bị qua mặt mà kết quả quan sát được không thay đổi. Những phát hiện này chỉ liên quan đến một tác nhân và môi trường; đóng góp rộng hơn là quy trình kiểm toán.

Ý chính

  • Chỉ dùng điểm tổng hợp cho nhiệm vụ có thể không xác định được thành phần nào tạo ra kết quả hoặc bộ xác minh chứng nhận điều gì.
  • Kiểm toán gắn bằng chứng, phán quyết gồm bốn khả năng và ranh giới phạm vi cho từng tuyên bố.
  • Chính sách oracle ước tính mức lợi ích có thể đạt được so với một tập hành động được xác định rõ.
  • Thay thế thành phần có thể xác định giá trị bị mất, nhưng tác động ở bước sau có thể khiến phát hiện chưa thể kết luận.
  • Các phát hiện từ thị trường tổng hợp chỉ áp dụng cho tác nhân và môi trường được nghiên cứu.

Thẻ

Toàn văn
# Verify Claims, Not Scores: Evidence-Based Verification of Modular Agents


# Verify Claims, Not Scores: Evidence-Based Verification of Modular Agents









When developers change one component of an agent, such as its controller, a learned model or its verifier, they usually judge the change by an aggregate task score. That score cannot tell whether improvement was attainable, which component lost value, or what the agent's own checks certify. We introduce a claim-specific verification audit for modular agents that plan, act, check and refine. Instead of scoring the agent, the audit scores the evidence: each conclusion is recorded with the evidence behind it, one of four verdicts (supported, unsupported, unresolved or not evaluated) and the boundary within which it holds. Three tools supply that evidence. Oracle policies measure attainable improvement under an explicitly stated action set, so that a low value can be traced to the evaluation rather than to the environment. Replacing one component at a time with a perfect counterpart locates lost value, with null results read as unresolved whenever a downstream component could mask them. A separate test asks whether the verifier's score identifies the quantity it is read as bounding. Applied to a constrained portfolio-allocation agent in a synthetic market with known hidden regimes, the audit shows that the value of perfect regime information depends on the action set used to measure it, that the scenario generator discards most of the regime signal while better local fidelity does not improve decisions, and that the runtime verifier can be bypassed with no visible change in outcomes. The contribution is the protocol and the evidential distinctions it enforces; the empirical findings are specific to the agent and environment studied.

Hiển thị toàn văn kèm ghi nguồn theo giấy phép của tài liệu gốc. Giấy phép: abstract CC0

Bản tóm tắt này do tác nhân nghiên cứu của Stratmill biên soạn từ tài liệu gốc; đây không phải bản sao của tài liệu.