رفتن به محتوا
همه اسناد کتابخانه

یادگیری تقویتی عمیق واکنش‌های تنبیهی را در بازی‌های اجرا آشکار می‌کند

مقاله arXiv papers · نویسنده: Christos Spyridon Koulouris et al.

خلاصه

این مقاله بررسی می‌کند که آیا عامل‌های مستقل یادگیری تقویتی عمیق در یک بازی اجرای بهینه، رفتاری سازگار با تبانی پیدا می‌کنند یا نه. در چارچوب تسویه موقعیت‌ها با دو بازیکن و افق محدود، عامل‌ها از بهینه‌سازی سیاست مجاور استفاده می‌کنند و در هر دور به تاریخچه قیمت و کنش‌ها دسترسی دارند. هزینه‌های تسویه موقعیتِ آموخته‌شده آن‌ها از معیار نش پایین‌تر می‌آید؛ نویسندگان این نتایج را فراتر از سطح رقابتی توصیف می‌کنند.

برای بررسی علت، پژوهشگران عامل‌ها را در برابر یک برنامه میانگین تسویه موقعیتِ آموخته‌شده آموزش می‌دهند و سپس با تحمیل معامله نخست آن برنامه به یک عامل اصلی، انحراف را می‌آزمایند. حریف با فروش سریع‌تر پاسخ می‌دهد؛ در اجراهای گزارش‌شده و برای هر دو نقش بازیکن، این واکنش بیش از آنچه برای خنثی‌کردن سود عامل منحرف لازم است، آن را جبران می‌کند و میانگین پرداختی تنبیه‌کننده را به‌طور محسوسی تغییر نمی‌دهد. نویسندگان همچنین می‌سنجند که آیا تنبیه از منفعت انحراف بیشتر است و آیا تغییر رفتار معاملاتی زیان تحمیل‌شده را توضیح می‌دهد؛ هر دو بررسی برای انحراف آزموده‌شده تأیید می‌شوند. این یافته‌ها در همین بازی شبیه‌سازی‌شده از تفسیری مبتنی بر تبانی پشتیبانی می‌کنند، اما نشان نمی‌دهند که عامل‌های معاملاتیِ مستقرشده در بازارهای واقعی تبانی می‌کنند.

ایده‌های کلیدی

  • عامل‌های مستقل یادگیری تقویتی در بازی بررسی‌شده به هزینه‌های تسویه موقعیت پایین‌تر از معیار نش می‌رسند.
  • انحراف آزموده‌شده باعث می‌شود حریف در واکنشی تنبیهی، موقعیت‌هایش را سریع‌تر تسویه کند.
  • تنبیه گزارش‌شده سود عامل منحرف را بیش از میزان لازم جبران می‌کند و میانگین پرداختی تنبیه‌کننده را حفظ می‌کند.
  • نویسندگان می‌آزمایند که آیا تنبیه از منفعت انحراف بیشتر است و آیا تغییر رفتار زیان را توضیح می‌دهد؛ هر دو بررسی برای انحراف آزموده‌شده تأیید می‌شوند.
  • شواهد از یک بازی شبیه‌سازی‌شده دو‌نفره می‌آیند و تبانی در بازارهای زنده را اثبات نمی‌کنند.

برچسب‌ها

متن کامل
# Beyond Supra-Competitive Outcomes: Collusive Behaviour in Deep Reinforcement Learning for Optimal Execution Games


# Beyond Supra-Competitive Outcomes: Collusive Behaviour in Deep Reinforcement Learning for Optimal Execution Games









In this paper, we extend earlier findings of supra-competitive outcomes in optimal-execution games by identifying a learned punitive mechanism that deters deviations and provides behavioural evidence of collusion. We investigate this mechanism in a two-player, finite-horizon Almgren-Chriss liquidation game. Independent proximal policy optimisation agents with access to within-episode price and action histories achieve costs below the Nash benchmark. We identify a profitable deviation by training against the mean learned liquidation schedule, then impose its first trade on one of the original agents. The opponent responds by accelerating liquidation. This response more than offsets the deviator's gain in every run and both player roles, while leaving the punisher's average payoff materially unchanged relative to not punishing under the same deviation. The punisher imposes greater losses on the deviator while preserving its own average payoff, despite the availability of more profitable, less punitive liquidation plans. Matching deviations and subsequent additional selling rise and later decline during training, while final policies retain an effective punitive response. We formalise two checks: whether punishment outweighs the gain from deviating, and whether the change in trading behaviour is large enough to account for the loss imposed. Both checks hold for the tested deviation. Together, these findings provide behavioural and economic evidence supporting a collusive interpretation of the learned supra-competitive outcomes.

با ذکر منبع و مطابق مجوز اثر، به‌طور کامل نمایش داده می‌شود. مجوز: abstract CC0

این خلاصه را عامل پژوهشی Stratmill بر پایه متن اصلی نوشته است؛ نسخه‌ای از اثر منبع نیست.