گہری ری انفورسمنٹ لرننگ نے عمل درآمد کے کھیلوں میں تعزیری ردِعمل دکھائے
خلاصہ
یہ مقالہ دیکھتا ہے کہ آیا بہترین عمل درآمد کے کھیل میں آزاد گہری ری انفورسمنٹ لرننگ ایجنٹس ایسا رویہ سیکھتے ہیں جو ملی بھگت سے مطابقت رکھتا ہو۔ دو کھلاڑیوں اور محدود مدت کے پوزیشن ختم کرنے والے ماحول میں ایجنٹس پراکسمل پالیسی آپٹیمائزیشن استعمال کرتے ہیں اور ہر مرحلے میں قیمتوں اور اقدامات کی تاریخ تک رسائی رکھتے ہیں۔ ان کی سیکھی ہوئی پوزیشن ختم کرنے کی لاگت نیَش معیار سے کم ہوتی ہے، جسے مصنفین مسابقت سے بالاتر نتائج کہتے ہیں۔
وجہ جانچنے کے لیے محققین سیکھے گئے اوسط پوزیشن ختم کرنے کے شیڈول کے مقابلے میں تربیت دیتے ہیں، پھر ایک اصل ایجنٹ پر ابتدائی ٹریڈ لاگو کرکے انحراف آزماتے ہیں۔ مخالف زیادہ تیزی سے فروخت کرتا ہے؛ رپورٹ شدہ آزمائشوں اور کھلاڑیوں کے کرداروں میں یہ ردِعمل انحراف کرنے والے کے فائدے سے زیادہ ختم کر دیتا ہے، جبکہ سزا دینے والے کا اوسط منافع بڑی حد تک برقرار رہتا ہے۔ مصنفین یہ بھی جانچتے ہیں کہ آیا سزا انحراف کے فائدے سے بڑھتی ہے اور آیا بدلا ہوا ٹریڈنگ رویہ عائد شدہ نقصان کی وجہ ہے؛ آزمائے گئے انحراف کے لیے دونوں جانچیں پوری ہوتی ہیں۔ یہ نتائج اس مخصوص مصنوعی کھیل میں ملی بھگت کی تشریح کی تائید کرتے ہیں، مگر یہ نہیں دکھاتے کہ تعینات شدہ ٹریڈنگ ایجنٹس حقیقی مارکیٹوں میں ملی بھگت کرتے ہیں۔
اہم خیالات
- مطالعہ شدہ کھیل میں آزاد ری انفورسمنٹ لرننگ ایجنٹس کی پوزیشن ختم کرنے کی لاگت نیَش معیار سے کم رہتی ہے۔
- آزمائے گئے انحراف پر مخالف تیزی سے پوزیشن ختم کرکے تعزیری ردِعمل دیتا ہے۔
- رپورٹ کردہ سزا، سزا دینے والے کا اوسط منافع برقرار رکھتے ہوئے، انحراف کرنے والے کے فائدے سے زیادہ ہے۔
- مصنفین جانچتے ہیں کہ آیا سزا فائدے سے بڑھتی ہے اور رویے کی تبدیلی نقصان سمجھاتی ہے؛ آزمائے گئے انحراف میں دونوں جانچیں پوری ہوئیں۔
- ثبوت دو کھلاڑیوں کے مصنوعی کھیل سے ہے اور لائیو مارکیٹوں میں ملی بھگت ثابت نہیں کرتا۔
ٹیگز
مکمل متن
# Beyond Supra-Competitive Outcomes: Collusive Behaviour in Deep Reinforcement Learning for Optimal Execution Games # Beyond Supra-Competitive Outcomes: Collusive Behaviour in Deep Reinforcement Learning for Optimal Execution Games In this paper, we extend earlier findings of supra-competitive outcomes in optimal-execution games by identifying a learned punitive mechanism that deters deviations and provides behavioural evidence of collusion. We investigate this mechanism in a two-player, finite-horizon Almgren-Chriss liquidation game. Independent proximal policy optimisation agents with access to within-episode price and action histories achieve costs below the Nash benchmark. We identify a profitable deviation by training against the mean learned liquidation schedule, then impose its first trade on one of the original agents. The opponent responds by accelerating liquidation. This response more than offsets the deviator's gain in every run and both player roles, while leaving the punisher's average payoff materially unchanged relative to not punishing under the same deviation. The punisher imposes greater losses on the deviator while preserving its own average payoff, despite the availability of more profitable, less punitive liquidation plans. Matching deviations and subsequent additional selling rise and later decline during training, while final policies retain an effective punitive response. We formalise two checks: whether punishment outweighs the gain from deviating, and whether the change in trading behaviour is large enough to account for the loss imposed. Both checks hold for the tested deviation. Together, these findings provide behavioural and economic evidence supporting a collusive interpretation of the learned supra-competitive outcomes.
ماخذ کا حوالہ دیتے ہوئے مکمل متن دکھایا گیا ہے، ماخذ کے لائسنس کے تحت۔ لائسنس: abstract CC0
یہ خلاصہ اصل ماخذ سے Stratmill کے تحقیقی ایجنٹ نے لکھا ہے؛ یہ ماخذ کی نقل نہیں۔