Évaluer PPO face à une politique de trading analytique pour courtier
Résumé
Cette étude teste si l’optimisation de politique proximale peut apprendre les décisions de vitesse de trading d’un courtier dans un jeu courtier-trader en temps continu dont la solution analytique est connue. Elle déduit une récompense discrète de l’objectif en temps continu et vérifie l’implémentation par raffinement de grille et une identité à un pas, puis compare les politiques apprises à la référence analytique dans des configurations avec ou sans flux stochastique d’ordres de traders non informés et avec ou sans information partielle.
En l’absence de flux non informé, une politique PPO à propagation directe se rapproche de l’action de référence. Avec un flux stochastique, les politiques PPO à propagation directe et récurrentes restent imprécises, même si l’apprentissage supervisé indique que leurs acteurs peuvent représenter la cible. Les diagnostics de Monte-Carlo montrent que les fonctions critiques peinent à classer des actions proches, et que la mise en forme de la récompense n’aide pas de manière fiable. Un contrôleur à équivalent certain fondé sur l’historique se rapproche davantage de la référence en présence d’informations partielles. PPO adapte une politique analytique figée à un coût d’exécution modifié, mais le gain rapporté ne comble qu’une faible partie de l’écart avec la nouvelle référence. Les résultats illustrent à la fois l’intérêt des références analytiques et les limites des méthodes RL testées.
Idées clés
- Un jeu de trading résolu analytiquement fournit une référence directe pour évaluer une politique d’apprentissage par renforcement.
- PPO s’approche de l’action de référence sans flux stochastique d’ordres non informés, mais reste imprécise dans la configuration stochastique testée.
- La capacité de représentation de l’acteur ne garantit pas des décisions précises si le critique classe mal les actions.
- Un contrôleur causal fondé sur l’historique observable reste plus proche de la référence en présence d’information partielle.
- Initialiser PPO à partir de la politique analytique permet une certaine adaptation à l’évolution des coûts d’exécution.
Étiquettes
Texte intégral
# When a Correct Reward Is Not Enough: Diagnosing and Guiding PPO in an Analytically Solved Broker-Trader Game # When a Correct Reward Is Not Enough: Diagnosing and Guiding PPO in an Analytically Solved Broker-Trader Game Reinforcement learning (RL) is increasingly used for financial optimal-control problems when complex dynamics make analytical strategies difficult to obtain. There are financial mathematics literactures which provides many solved models whose equations and controls could evaluate and guide learning; we ask whether RL can exploit these results. We place a proximal policy optimisation (PPO) agent in an analytically solved continuous-time broker--trader game. PPO replaces the broker and chooses its trading speed while interacting with an informed trader and stochastic uninformed order flow. We derive a finite-step reward from the broker's continuous-time payoff and verify its discrete implementation through grid refinement and an exact one-step identity. With zero uninformed flow, a validation-selected PPO--FFNN approaches the reference action. With stochastic uninformed flow, the tested PPO--FFNN and PPO--LSTM remain inaccurate, although supervised learning confirms that their actors can represent the action. Monte Carlo diagnostics show that their critics do not reliably rank nearby actions; potential-based reward shaping also gives no reliable improvement. Under partial information, a causal certainty-equivalent controller based on the broker's observable history remains close to the reference, while PPO has larger errors and lower payoffs. Finally, we freeze the analytical policy and train PPO to adjust it after the execution cost changes. Halving the cost yields a repeatable improvement that closes \(2.22\%\) of the gap to the changed-cost reference. The analytical solution therefore provides both a benchmark for diagnosing RL and a useful starting policy for adaptation.
Reproduit dans son intégralité avec attribution, conformément à la licence de la source. Licence: abstract CC0
Ce résumé a été rédigé par l’agent de recherche de Stratmill à partir de la source originale ; il n’en est pas une copie.