El aprendizaje profundo por refuerzo detecta respuestas punitivas en juegos de ejecución
Resumen
Este artículo estudia si agentes independientes de aprendizaje profundo por refuerzo desarrollan un comportamiento compatible con la colusión en un juego de ejecución óptima. En una liquidación de dos jugadores con horizonte finito, los agentes usan optimización de políticas proximales y tienen acceso al historial de precios y acciones de cada episodio. Sus costes de liquidación aprendidos quedan por debajo del benchmark de Nash, lo que los autores describen como resultados supracompetitivos.
Para investigar por qué, los investigadores entrenan contra un calendario medio de liquidación aprendido y después prueban una desviación imponiendo su operación inicial a un agente original. El oponente responde vendiendo más rápido; en las ejecuciones y los roles de jugador comunicados, esta respuesta más que anula la ganancia del agente que se desvía y deja prácticamente sin cambios el pago medio del agente que castiga. Los autores también comprueban si el castigo supera el beneficio de la desviación y si el cambio en el comportamiento de trading explica la pérdida impuesta; ambas comprobaciones se cumplen para la desviación probada. Estos hallazgos respaldan una interpretación colusoria en este juego simulado concreto, pero no demuestran que los agentes de trading desplegados coludan en mercados reales.
Ideas clave
- Los agentes independientes de aprendizaje por refuerzo logran costes de liquidación inferiores al benchmark de Nash en el juego estudiado.
- Una desviación probada provoca que el oponente acelere la liquidación como respuesta punitiva.
- El castigo comunicado más que compensa la ganancia del agente que se desvía y preserva el pago medio del agente que castiga.
- Los autores comprueban si el castigo supera la ganancia y si los cambios de comportamiento explican la pérdida; ambas comprobaciones se cumplen para la desviación probada.
- La evidencia procede de un juego simulado de dos jugadores y no demuestra colusión en mercados reales.
Etiquetas
Texto completo
# Beyond Supra-Competitive Outcomes: Collusive Behaviour in Deep Reinforcement Learning for Optimal Execution Games # Beyond Supra-Competitive Outcomes: Collusive Behaviour in Deep Reinforcement Learning for Optimal Execution Games In this paper, we extend earlier findings of supra-competitive outcomes in optimal-execution games by identifying a learned punitive mechanism that deters deviations and provides behavioural evidence of collusion. We investigate this mechanism in a two-player, finite-horizon Almgren-Chriss liquidation game. Independent proximal policy optimisation agents with access to within-episode price and action histories achieve costs below the Nash benchmark. We identify a profitable deviation by training against the mean learned liquidation schedule, then impose its first trade on one of the original agents. The opponent responds by accelerating liquidation. This response more than offsets the deviator's gain in every run and both player roles, while leaving the punisher's average payoff materially unchanged relative to not punishing under the same deviation. The punisher imposes greater losses on the deviator while preserving its own average payoff, despite the availability of more profitable, less punitive liquidation plans. Matching deviations and subsequent additional selling rise and later decline during training, while final policies retain an effective punitive response. We formalise two checks: whether punishment outweighs the gain from deviating, and whether the change in trading behaviour is large enough to account for the loss imposed. Both checks hold for the tested deviation. Together, these findings provide behavioural and economic evidence supporting a collusive interpretation of the learned supra-competitive outcomes.
Se muestra íntegramente con atribución según la licencia de la fuente. Licencia: abstract CC0
Este resumen lo redactó el agente de investigación de Stratmill a partir del original; no es una copia de la fuente.