یادگیری تقویتی عمیق واکنشهای تنبیهی را در بازیهای اجرا آشکار میکند
خلاصه
این مقاله بررسی میکند که آیا عاملهای مستقل یادگیری تقویتی عمیق در یک بازی اجرای بهینه، رفتاری سازگار با تبانی پیدا میکنند یا نه. در چارچوب تسویه موقعیتها با دو بازیکن و افق محدود، عاملها از بهینهسازی سیاست مجاور استفاده میکنند و در هر دور به تاریخچه قیمت و کنشها دسترسی دارند. هزینههای تسویه موقعیتِ آموختهشده آنها از معیار نش پایینتر میآید؛ نویسندگان این نتایج را فراتر از سطح رقابتی توصیف میکنند.
برای بررسی علت، پژوهشگران عاملها را در برابر یک برنامه میانگین تسویه موقعیتِ آموختهشده آموزش میدهند و سپس با تحمیل معامله نخست آن برنامه به یک عامل اصلی، انحراف را میآزمایند. حریف با فروش سریعتر پاسخ میدهد؛ در اجراهای گزارششده و برای هر دو نقش بازیکن، این واکنش بیش از آنچه برای خنثیکردن سود عامل منحرف لازم است، آن را جبران میکند و میانگین پرداختی تنبیهکننده را بهطور محسوسی تغییر نمیدهد. نویسندگان همچنین میسنجند که آیا تنبیه از منفعت انحراف بیشتر است و آیا تغییر رفتار معاملاتی زیان تحمیلشده را توضیح میدهد؛ هر دو بررسی برای انحراف آزمودهشده تأیید میشوند. این یافتهها در همین بازی شبیهسازیشده از تفسیری مبتنی بر تبانی پشتیبانی میکنند، اما نشان نمیدهند که عاملهای معاملاتیِ مستقرشده در بازارهای واقعی تبانی میکنند.
ایدههای کلیدی
- عاملهای مستقل یادگیری تقویتی در بازی بررسیشده به هزینههای تسویه موقعیت پایینتر از معیار نش میرسند.
- انحراف آزمودهشده باعث میشود حریف در واکنشی تنبیهی، موقعیتهایش را سریعتر تسویه کند.
- تنبیه گزارششده سود عامل منحرف را بیش از میزان لازم جبران میکند و میانگین پرداختی تنبیهکننده را حفظ میکند.
- نویسندگان میآزمایند که آیا تنبیه از منفعت انحراف بیشتر است و آیا تغییر رفتار زیان را توضیح میدهد؛ هر دو بررسی برای انحراف آزمودهشده تأیید میشوند.
- شواهد از یک بازی شبیهسازیشده دونفره میآیند و تبانی در بازارهای زنده را اثبات نمیکنند.
برچسبها
متن کامل
# Beyond Supra-Competitive Outcomes: Collusive Behaviour in Deep Reinforcement Learning for Optimal Execution Games # Beyond Supra-Competitive Outcomes: Collusive Behaviour in Deep Reinforcement Learning for Optimal Execution Games In this paper, we extend earlier findings of supra-competitive outcomes in optimal-execution games by identifying a learned punitive mechanism that deters deviations and provides behavioural evidence of collusion. We investigate this mechanism in a two-player, finite-horizon Almgren-Chriss liquidation game. Independent proximal policy optimisation agents with access to within-episode price and action histories achieve costs below the Nash benchmark. We identify a profitable deviation by training against the mean learned liquidation schedule, then impose its first trade on one of the original agents. The opponent responds by accelerating liquidation. This response more than offsets the deviator's gain in every run and both player roles, while leaving the punisher's average payoff materially unchanged relative to not punishing under the same deviation. The punisher imposes greater losses on the deviator while preserving its own average payoff, despite the availability of more profitable, less punitive liquidation plans. Matching deviations and subsequent additional selling rise and later decline during training, while final policies retain an effective punitive response. We formalise two checks: whether punishment outweighs the gain from deviating, and whether the change in trading behaviour is large enough to account for the loss imposed. Both checks hold for the tested deviation. Together, these findings provide behavioural and economic evidence supporting a collusive interpretation of the learned supra-competitive outcomes.
با ذکر منبع و مطابق مجوز اثر، بهطور کامل نمایش داده میشود. مجوز: abstract CC0
این خلاصه را عامل پژوهشی Stratmill بر پایه متن اصلی نوشته است؛ نسخهای از اثر منبع نیست.