Aprendizado por reforço robusto e sensível ao risco para estratégias de carteira
Resumo
Este trabalho desenvolve uma abordagem de aprendizado por reforço para otimizar políticas segundo critérios de desempenho sensíveis ao risco. Avalia as políticas com utilidade esperada dependente de postos, que permite a um agente expressar diferentes preferências por ganhos e resultados negativos. Para lidar com a incerteza do modelo, a política é avaliada sob a distribuição de retornos de pior caso dentro de uma bola de distância de Wasserstein em torno da distribuição modelada. Isso cria um problema de decisão aninhado: o agente seleciona uma política e, em seguida, um adversário escolhe uma distribuição próxima que reduz seu desempenho.
Os autores derivam fórmulas de gradiente de política tanto para a seleção da política quanto para os problemas de distribuição adversarial. Demonstram o método em alocação robusta de carteira, otimização de benchmark e arbitragem estatística. Essas aplicações mostram o escopo pretendido da estrutura, mas o documento não apresenta números comparativos de desempenho, detalhes dos dados de mercado ou orientações práticas de implementação. Sua utilidade depende, portanto, de validação adicional do modelo, do conjunto de incerteza e das preferências de risco em um contexto específico de trading.
Ideias principais
- A utilidade esperada dependente de postos permite que as políticas codifiquem diferentes escolhas entre ganhos e risco de perdas.
- A estrutura avalia cada política diante de uma distribuição de pior caso dentro de uma vizinhança de Wasserstein.
- Um problema interno adversarial busca uma distribuição que reduza o desempenho da política escolhida.
- Os autores derivam gradientes de política tanto para a otimização da política quanto para o problema adversarial.
- As demonstrações abrangem alocação de carteira, otimização de benchmark e arbitragem estatística.
Tags
Texto completo
# Robust Risk-Aware Reinforcement Learning # Robust Risk-Aware Reinforcement Learning We present a reinforcement learning (RL) approach for robust optimisation of risk-aware performance criteria. To allow agents to express a wide variety of risk-reward profiles, we assess the value of a policy using rank dependent expected utility (RDEU). RDEU allows the agent to seek gains, while simultaneously protecting themselves against downside risk. To robustify optimal policies against model uncertainty, we assess a policy not by its distribution, but rather, by the worst possible distribution that lies within a Wasserstein ball around it. Thus, our problem formulation may be viewed as an actor/agent choosing a policy (the outer problem), and the adversary then acting to worsen the performance of that strategy (the inner problem). We develop explicit policy gradient formulae for the inner and outer problems, and show its efficacy on three prototypical financial problems: robust portfolio allocation, optimising a benchmark, and statistical arbitrage.
Exibido na íntegra, com atribuição conforme a licença da fonte. Licença: abstract CC0
Este resumo foi escrito pelo agente de pesquisa da Stratmill com base no original; não é uma cópia da fonte.