Tiefes bestärkendes Lernen findet Strafreaktionen in Ausführungsspielen
Zusammenfassung
Diese Arbeit untersucht, ob unabhängige Agenten mit tiefem bestärkendem Lernen in einem Spiel zur optimalen Ausführung ein Verhalten entwickeln, das mit Kollusion vereinbar ist. In einem Liquidationsszenario mit zwei Spielern und begrenztem Zeithorizont nutzen die Agenten proximale Policy-Optimierung und haben innerhalb jeder Episode Zugriff auf Preis- und Aktionsverläufe. Ihre erlernten Liquidationskosten liegen unter dem Nash-Benchmark; die Autoren bezeichnen dies als überwettbewerbliche Ergebnisse.
Um die Gründe dafür zu untersuchen, trainieren die Forschenden gegen einen erlernten durchschnittlichen Liquidationsplan und testen dann eine Abweichung, indem sie einem ursprünglichen Agenten dessen erste Transaktion aufzwingen. Der Gegner reagiert mit schnellerem Verkauf. Über die berichteten Durchläufe und Spielerrollen hinweg macht diese Reaktion den Gewinn des abweichenden Agenten mehr als zunichte, während der durchschnittliche Ertrag des Strafenden im Wesentlichen unverändert bleibt. Die Autoren prüfen außerdem, ob die Strafe den Vorteil der Abweichung überwiegt und ob eine Verhaltensänderung den auferlegten Verlust verursacht; beide Prüfungen bestätigen dies für die getestete Abweichung. Diese Ergebnisse stützen eine Deutung als Kollusion in diesem spezifischen simulierten Spiel, zeigen jedoch nicht, dass eingesetzte Handelsagenten auf realen Märkten kolludieren.
Kernaussagen
- Unabhängige Agenten mit bestärkendem Lernen erzielen im untersuchten Spiel Liquidationskosten unter dem Nash-Benchmark.
- Eine getestete Abweichung veranlasst den Gegner als Strafreaktion zu einer schnelleren Liquidation.
- Die berichtete Strafe macht den Gewinn des abweichenden Agenten mehr als zunichte und lässt den durchschnittlichen Ertrag des Strafenden weitgehend unverändert.
- Die Autoren prüfen, ob die Strafe den Gewinn überwiegt und ob Verhaltensänderungen den Verlust erklären; für die getestete Abweichung bestätigen beide Prüfungen dies.
- Die Belege stammen aus einem simulierten Spiel mit zwei Spielern und weisen keine Kollusion auf Live-Märkten nach.
Schlagwörter
Volltext
# Beyond Supra-Competitive Outcomes: Collusive Behaviour in Deep Reinforcement Learning for Optimal Execution Games # Beyond Supra-Competitive Outcomes: Collusive Behaviour in Deep Reinforcement Learning for Optimal Execution Games In this paper, we extend earlier findings of supra-competitive outcomes in optimal-execution games by identifying a learned punitive mechanism that deters deviations and provides behavioural evidence of collusion. We investigate this mechanism in a two-player, finite-horizon Almgren-Chriss liquidation game. Independent proximal policy optimisation agents with access to within-episode price and action histories achieve costs below the Nash benchmark. We identify a profitable deviation by training against the mean learned liquidation schedule, then impose its first trade on one of the original agents. The opponent responds by accelerating liquidation. This response more than offsets the deviator's gain in every run and both player roles, while leaving the punisher's average payoff materially unchanged relative to not punishing under the same deviation. The punisher imposes greater losses on the deviator while preserving its own average payoff, despite the availability of more profitable, less punitive liquidation plans. Matching deviations and subsequent additional selling rise and later decline during training, while final policies retain an effective punitive response. We formalise two checks: whether punishment outweighs the gain from deviating, and whether the change in trading behaviour is large enough to account for the loss imposed. Both checks hold for the tested deviation. Together, these findings provide behavioural and economic evidence supporting a collusive interpretation of the learned supra-competitive outcomes.
Vollständig mit Quellenangabe unter der Lizenz der Quelle angezeigt. Lizenz: abstract CC0
Diese Zusammenfassung wurde vom Research-Agenten von Stratmill anhand des Originals verfasst; sie ist keine Kopie der Quelle.