Saltar al contenido
Todos los documentos de la biblioteca

Diagnóstico de PPO frente a una política analítica de trading del bróker | Stratmill

Artículo arXiv papers · Autor: Siu Tung Wong (Institute of Finance and Technology et al.

Resumen

Este estudio comprueba si la optimización de políticas proximales puede aprender las decisiones de velocidad de trading de un bróker en un juego continuo entre bróker y operador con solución analítica. Deriva una recompensa discreta a partir del objetivo de tiempo continuo y verifica la implementación mediante refinamiento de la cuadrícula y una identidad de un paso; después compara las políticas aprendidas con la referencia analítica, con y sin flujo estocástico de órdenes de operadores desinformados y con información parcial.

Sin flujo desinformado, una política PPO de propagación hacia delante se aproxima a la acción de referencia. Con flujo estocástico, las políticas PPO de propagación hacia delante y recurrentes siguen siendo imprecisas, aunque el aprendizaje supervisado indica que sus actores pueden representar el objetivo. Los diagnósticos de Monte Carlo apuntan a críticos que tienen dificultades para ordenar acciones cercanas, y el moldeado de recompensas no ayuda de forma fiable. Un controlador de equivalencia de certeza basado en el historial se acerca más a la referencia con información parcial. PPO adapta una política analítica congelada a un coste de ejecución distinto, pero la mejora comunicada solo reduce una pequeña parte de la brecha con la nueva referencia. Los resultados muestran tanto el valor de las referencias analíticas como los límites de los métodos de RL evaluados.

Ideas clave

  • Un juego de trading con solución analítica proporciona una referencia directa para evaluar una política de aprendizaje por refuerzo.
  • PPO se acerca a la acción de referencia sin flujo estocástico de órdenes desinformadas, pero resulta imprecisa en el escenario estocástico evaluado.
  • La capacidad de representación del actor no garantiza decisiones precisas si el crítico ordena las acciones de forma poco fiable.
  • Un controlador causal basado en el historial observable se mantiene más cerca de la referencia con información parcial.
  • Iniciar PPO desde la política analítica permite cierta adaptación a cambios en los costes de ejecución.

Etiquetas

Texto completo
# When a Correct Reward Is Not Enough: Diagnosing and Guiding PPO in an Analytically Solved Broker-Trader Game


# When a Correct Reward Is Not Enough: Diagnosing and Guiding PPO in an Analytically Solved Broker-Trader Game









Reinforcement learning (RL) is increasingly used for financial optimal-control problems when complex dynamics make analytical strategies difficult to obtain. There are financial mathematics literactures which provides many solved models whose equations and controls could evaluate and guide learning; we ask whether RL can exploit these results. We place a proximal policy optimisation (PPO) agent in an analytically solved continuous-time broker--trader game. PPO replaces the broker and chooses its trading speed while interacting with an informed trader and stochastic uninformed order flow. We derive a finite-step reward from the broker's continuous-time payoff and verify its discrete implementation through grid refinement and an exact one-step identity. With zero uninformed flow, a validation-selected PPO--FFNN approaches the reference action. With stochastic uninformed flow, the tested PPO--FFNN and PPO--LSTM remain inaccurate, although supervised learning confirms that their actors can represent the action. Monte Carlo diagnostics show that their critics do not reliably rank nearby actions; potential-based reward shaping also gives no reliable improvement. Under partial information, a causal certainty-equivalent controller based on the broker's observable history remains close to the reference, while PPO has larger errors and lower payoffs. Finally, we freeze the analytical policy and train PPO to adjust it after the execution cost changes. Halving the cost yields a repeatable improvement that closes \(2.22\%\) of the gap to the changed-cost reference. The analytical solution therefore provides both a benchmark for diagnosing RL and a useful starting policy for adaptation.

Se muestra íntegramente con atribución según la licencia de la fuente. Licencia: abstract CC0

Este resumen lo redactó el agente de investigación de Stratmill a partir del original; no es una copia de la fuente.