Pular para o conteúdo
Todos os documentos da biblioteca

Objetivos convexos de risco no aprendizado por reforço para trading

Artigo arXiv papers · Autor: Shanyu Han et al.

Resumo

Este artigo apresenta uma estrutura de aprendizado por reforço para problemas de decisão com objetivos de risco expressos por funções de pontuação convexas. A estrutura pode representar medidas como variância, Expected Shortfall e Value-at-Risk entrópico, além de utilidade de média e risco. O foco é tornar esses objetivos aplicáveis ao longo do tempo, pois otimizar o risco pode gerar inconsistência temporal: uma política preferida em um momento pode deixar de ser preferida em uma etapa posterior de decisão.

Para lidar com isso, os autores acrescentam uma variável auxiliar ao estado e reformulam o problema como uma otimização em dois estados. Eles descrevem um algoritmo Actor-Critic personalizado, garantias teóricas de aproximação que não exigem um processo de decisão de Markov contínuo e um procedimento de amostragem com variável auxiliar inspirado na minimização alternada. O artigo relata experimentos de simulação, incluindo uma aplicação de arbitragem estatística, como evidência da eficácia do método. A descrição disponível não apresenta resultados numéricos nem detalhes da configuração experimental, e a convergência do método de amostragem depende das premissas declaradas; portanto, o desempenho prático além das simulações testadas é incerto.

Ideias principais

  • Funções de pontuação convexas podem expressar várias medidas conhecidas de risco em um objetivo de aprendizado por reforço.
  • Acrescentar uma variável auxiliar ao estado ajuda a lidar com a inconsistência temporal em decisões sensíveis ao risco.
  • O método Actor-Critic proposto inclui garantias de aproximação que não exigem um processo de estados contínuos.
  • Relata-se que um método de amostragem inspirado na minimização alternada converge sob certas condições.
  • Os experimentos de simulação incluem uma aplicação de trading de arbitragem estatística.

Tags

Texto completo
# Risk-sensitive Reinforcement Learning Based on Convex Scoring Functions


# Risk-sensitive Reinforcement Learning Based on Convex Scoring Functions









We propose a reinforcement learning (RL) framework under a broad class of risk objectives, characterized by convex scoring functions. This class covers many common risk measures, such as variance, Expected Shortfall, entropic Value-at-Risk, and mean-risk utility. To resolve the time-inconsistency issue, we consider an augmented state space and an auxiliary variable and recast the problem as a two-state optimization problem. We propose a customized Actor-Critic algorithm and establish some theoretical approximation guarantees. A key theoretical contribution is that our results do not require the Markov decision process to be continuous. Additionally, we propose an auxiliary variable sampling method inspired by the alternating minimization algorithm, which is convergent under certain conditions. We validate our approach in simulation experiments with a financial application in statistical arbitrage trading, demonstrating the effectiveness of the algorithm.

Exibido na íntegra, com atribuição conforme a licença da fonte. Licença: abstract CC0

Este resumo foi escrito pelo agente de pesquisa da Stratmill com base no original; não é uma cópia da fonte.