Passer au contenu
Tous les documents de la bibliothèque

L’apprentissage profond par renforcement révèle des réponses punitives dans les jeux d’exécution

Article arXiv papers · Auteur: Christos Spyridon Koulouris et al.

Résumé

Cet article étudie si des agents indépendants d’apprentissage profond par renforcement développent un comportement compatible avec la collusion dans un jeu d’exécution optimale. Dans un cadre de liquidation à deux joueurs et à horizon fini, les agents utilisent l’optimisation de politique proximale et disposent de l’historique des prix et des actions au cours de chaque épisode. Leurs coûts de liquidation appris passent sous le seuil de Nash, ce que les auteurs décrivent comme des résultats supra-concurrentiels.

Pour en rechercher la cause, les chercheurs entraînent les agents contre un calendrier moyen de liquidation appris, puis testent une déviation en imposant sa transaction initiale à un agent du modèle initial. L’adversaire réagit en vendant plus vite ; dans les simulations et les rôles de joueurs rapportés, cette réaction annule plus que le gain de l’agent déviant, tout en laissant le gain moyen de l’agent punitif sensiblement inchangé. Les auteurs vérifient également si la punition dépasse le bénéfice de la déviation et si le changement de comportement de trading explique la perte imposée ; ces deux vérifications sont concluantes pour la déviation testée. Ces résultats étayent une interprétation en termes de collusion dans ce jeu simulé précis, mais ne montrent pas que les agents de trading déployés colludent sur les marchés réels.

Idées clés

  • Dans le jeu étudié, les agents indépendants d’apprentissage par renforcement obtiennent des coûts de liquidation inférieurs au seuil de Nash.
  • Une déviation testée incite l’adversaire à accélérer la liquidation en réaction punitive.
  • La punition rapportée compense plus que le gain de l’agent déviant tout en préservant le gain moyen de l’agent punitif.
  • Les auteurs vérifient si la punition dépasse le gain et si les changements de comportement expliquent la perte ; les deux tests sont concluants pour la déviation testée.
  • Les éléments proviennent d’un jeu simulé à deux joueurs et n’établissent pas de collusion sur les marchés réels.

Étiquettes

Texte intégral
# Beyond Supra-Competitive Outcomes: Collusive Behaviour in Deep Reinforcement Learning for Optimal Execution Games


# Beyond Supra-Competitive Outcomes: Collusive Behaviour in Deep Reinforcement Learning for Optimal Execution Games









In this paper, we extend earlier findings of supra-competitive outcomes in optimal-execution games by identifying a learned punitive mechanism that deters deviations and provides behavioural evidence of collusion. We investigate this mechanism in a two-player, finite-horizon Almgren-Chriss liquidation game. Independent proximal policy optimisation agents with access to within-episode price and action histories achieve costs below the Nash benchmark. We identify a profitable deviation by training against the mean learned liquidation schedule, then impose its first trade on one of the original agents. The opponent responds by accelerating liquidation. This response more than offsets the deviator's gain in every run and both player roles, while leaving the punisher's average payoff materially unchanged relative to not punishing under the same deviation. The punisher imposes greater losses on the deviator while preserving its own average payoff, despite the availability of more profitable, less punitive liquidation plans. Matching deviations and subsequent additional selling rise and later decline during training, while final policies retain an effective punitive response. We formalise two checks: whether punishment outweighs the gain from deviating, and whether the change in trading behaviour is large enough to account for the loss imposed. Both checks hold for the tested deviation. Together, these findings provide behavioural and economic evidence supporting a collusive interpretation of the learned supra-competitive outcomes.

Reproduit dans son intégralité avec attribution, conformément à la licence de la source. Licence: abstract CC0

Ce résumé a été rédigé par l’agent de recherche de Stratmill à partir de la source originale ; il n’en est pas une copie.