مواد پر جائیں
لائبریری کی تمام دستاویزات

ٹریڈنگ ایجنٹس کے لیے شواہد پر مبنی آڈٹ

مضمون arXiv papers · مصنف: Ali Atiah Alzahrani

خلاصہ

یہ مقالہ ماڈیولر ایجنٹس کے لیے دعوے کی سطح پر آڈٹ تجویز کرتا ہے جو منصوبہ بندی، عمل، جانچ اور اصلاح کرتے ہیں؛ اس کی وجہ کسی ایک مجموعی کام کے اسکور پر انحصار کی حدود ہیں۔ آڈٹ ہر نتیجے کے لیے ثبوت درج کرتا ہے، تائید شدہ، غیر تائید شدہ، غیر حل شدہ یا جانچا نہیں گیا کا فیصلہ دیتا ہے، اور اس حد کو بیان کرتا ہے جس کے اندر نتیجہ لاگو ہوتا ہے۔ اس کا مقصد واضح کرنا ہے کہ کسی ایجنٹ اور اس کے اجزا کے بارے میں جانچ کیا ثابت کرتی ہے۔

تین طریقے شواہد فراہم کرتے ہیں: اوریکل پالیسیاں مخصوص عمل کے مجموعے کے لیے ممکنہ بہتری ناپتی ہیں؛ مثالی جزو سے باری باری تبدیلی ضائع شدہ قدر کی نشاندہی میں مدد کرتی ہے، تاہم بعد کے مراحل میں اثر چھپ جانے کا امکان رہتا ہے؛ اور الگ جانچ یہ دیکھتی ہے کہ آیا تصدیق کنندہ کا اسکور واقعی اس سے منسوب حد کی تائید کرتا ہے۔ پوشیدہ نظاموں والی مصنوعی مارکیٹ میں آڈٹ پاتا ہے کہ کامل نظامی معلومات کی ناپی گئی قدر عمل کے مجموعے کے ساتھ بدلتی ہے، منظرنامہ بنانے والا نظامی سگنل کا بڑا حصہ کھو دیتا ہے، اور رَن ٹائم تصدیق کنندہ کو نتائج میں نمایاں تبدیلی کے بغیر نظرانداز کیا جا سکتا ہے۔ یہ نتائج ایک ایجنٹ اور ماحول سے متعلق ہیں؛ وسیع تر حصہ پروٹوکول ہے۔

اہم خیالات

  • صرف مجموعی کام کے اسکور سے یہ معلوم نہیں ہو سکتا کہ نتیجے کا سبب کون سا جزو تھا یا تصدیق کنندہ کیا تصدیق کرتا ہے۔
  • آڈٹ ہر دعوے کے ساتھ ثبوت، چار ممکنہ فیصلوں میں سے ایک اور اطلاق کی حد منسلک کرتا ہے۔
  • اوریکل پالیسیاں واضح طور پر متعین عمل کے مجموعے کے مقابلے میں ممکنہ فائدے کا تخمینہ دیتی ہیں۔
  • جزو کی تبدیلی ضائع شدہ قدر کی نشاندہی کر سکتی ہے، مگر بعد کے اثرات نتائج کو غیر حل شدہ چھوڑ سکتے ہیں۔
  • مصنوعی مارکیٹ کے نتائج زیرِ مطالعہ ایجنٹ اور ماحول سے مخصوص ہیں۔

ٹیگز

مکمل متن
# Verify Claims, Not Scores: Evidence-Based Verification of Modular Agents


# Verify Claims, Not Scores: Evidence-Based Verification of Modular Agents









When developers change one component of an agent, such as its controller, a learned model or its verifier, they usually judge the change by an aggregate task score. That score cannot tell whether improvement was attainable, which component lost value, or what the agent's own checks certify. We introduce a claim-specific verification audit for modular agents that plan, act, check and refine. Instead of scoring the agent, the audit scores the evidence: each conclusion is recorded with the evidence behind it, one of four verdicts (supported, unsupported, unresolved or not evaluated) and the boundary within which it holds. Three tools supply that evidence. Oracle policies measure attainable improvement under an explicitly stated action set, so that a low value can be traced to the evaluation rather than to the environment. Replacing one component at a time with a perfect counterpart locates lost value, with null results read as unresolved whenever a downstream component could mask them. A separate test asks whether the verifier's score identifies the quantity it is read as bounding. Applied to a constrained portfolio-allocation agent in a synthetic market with known hidden regimes, the audit shows that the value of perfect regime information depends on the action set used to measure it, that the scenario generator discards most of the regime signal while better local fidelity does not improve decisions, and that the runtime verifier can be bypassed with no visible change in outcomes. The contribution is the protocol and the evidential distinctions it enforces; the empirical findings are specific to the agent and environment studied.

ماخذ کا حوالہ دیتے ہوئے مکمل متن دکھایا گیا ہے، ماخذ کے لائسنس کے تحت۔ لائسنس: abstract CC0

یہ خلاصہ اصل ماخذ سے Stratmill کے تحقیقی ایجنٹ نے لکھا ہے؛ یہ ماخذ کی نقل نہیں۔