Diagnóstico de PPO frente a uma política analítica de trading de corretora
Resumo
Este estudo testa se a otimização de política proximal consegue aprender decisões de velocidade de trading de uma corretora em um jogo contínuo no tempo entre corretora e trader, com solução analítica. Ele deriva uma recompensa discreta do objetivo em tempo contínuo e verifica a implementação com refinamento de grade e uma identidade de um passo; em seguida, compara as políticas aprendidas com a referência analítica em cenários com e sem fluxo estocástico de ordens de participantes desinformados e com informação parcial.
Sem fluxo desinformado, uma política PPO feedforward se aproxima da ação de referência. Com fluxo estocástico, as políticas PPO feedforward e recorrente continuam imprecisas, embora o aprendizado supervisionado indique que seus atores conseguem representar o alvo. Diagnósticos de Monte Carlo apontam que os críticos têm dificuldade para ordenar ações próximas, e a modelagem da recompensa não ajuda de forma confiável. Um controlador baseado no histórico e equivalente em certeza fica mais próximo da referência sob informação parcial. PPO adapta uma política analítica congelada a um custo de execução alterado, mas o ganho relatado fecha apenas uma pequena parte da distância até a nova referência. Os resultados ilustram tanto o valor de referências analíticas quanto os limites dos métodos de RL testados.
Ideias principais
- Um jogo de trading com solução analítica fornece uma referência direta para avaliar uma política de aprendizado por reforço.
- PPO se aproxima da ação de referência sem fluxo estocástico de ordens desinformadas, mas é imprecisa no cenário estocástico testado.
- A capacidade de representação do ator não garante decisões precisas quando o crítico ordena ações de forma pouco confiável.
- Um controlador causal baseado no histórico observável permanece mais próximo da referência sob informação parcial.
- Iniciar PPO a partir da política analítica permite alguma adaptação a custos de execução alterados.
Tags
Texto completo
# When a Correct Reward Is Not Enough: Diagnosing and Guiding PPO in an Analytically Solved Broker-Trader Game # When a Correct Reward Is Not Enough: Diagnosing and Guiding PPO in an Analytically Solved Broker-Trader Game Reinforcement learning (RL) is increasingly used for financial optimal-control problems when complex dynamics make analytical strategies difficult to obtain. There are financial mathematics literactures which provides many solved models whose equations and controls could evaluate and guide learning; we ask whether RL can exploit these results. We place a proximal policy optimisation (PPO) agent in an analytically solved continuous-time broker--trader game. PPO replaces the broker and chooses its trading speed while interacting with an informed trader and stochastic uninformed order flow. We derive a finite-step reward from the broker's continuous-time payoff and verify its discrete implementation through grid refinement and an exact one-step identity. With zero uninformed flow, a validation-selected PPO--FFNN approaches the reference action. With stochastic uninformed flow, the tested PPO--FFNN and PPO--LSTM remain inaccurate, although supervised learning confirms that their actors can represent the action. Monte Carlo diagnostics show that their critics do not reliably rank nearby actions; potential-based reward shaping also gives no reliable improvement. Under partial information, a causal certainty-equivalent controller based on the broker's observable history remains close to the reference, while PPO has larger errors and lower payoffs. Finally, we freeze the analytical policy and train PPO to adjust it after the execution cost changes. Halving the cost yields a repeatable improvement that closes \(2.22\%\) of the gap to the changed-cost reference. The analytical solution therefore provides both a benchmark for diagnosing RL and a useful starting policy for adaptation.
Exibido na íntegra, com atribuição conforme a licença da fonte. Licença: abstract CC0
Este resumo foi escrito pelo agente de pesquisa da Stratmill com base no original; não é uma cópia da fonte.