Pular para o conteúdo
Todos os documentos da biblioteca

Aprendizado por reforço com gradiente de política e medidas dinâmicas de risco convexo

Artigo arXiv papers · Autor: Anthony Coache et al.

Resumo

O documento apresenta um método de aprendizado por reforço sem modelo para otimização sequencial quando os resultados são avaliados com medidas dinâmicas de risco convexo. Ele usa um princípio de programação dinâmica temporalmente consistente para valorar políticas e, em seguida, deriva atualizações de gradiente de política para encontrar políticas melhores. Uma abordagem ator-crítico com redes neurais é proposta para otimizar essas políticas.

O método é demonstrado em três tarefas: negociação de arbitragem estatística, proteção financeira e controle de desvio de obstáculos para um robô. Isso mostra que a estrutura é aplicada tanto em contextos financeiros quanto não financeiros, mas a descrição não fornece números de desempenho, métodos de comparação, premissas de mercado nem detalhes de implementação. Assim, apresenta a estrutura de otimização e o escopo das aplicações, mas não especifica evidências sobre a eficácia da negociação ou limitações práticas.

Ideias principais

  • Medidas dinâmicas de risco convexo oferecem uma forma de avaliar sequências de resultados incertos.
  • A programação dinâmica temporalmente consistente é usada para valorar políticas candidatas.
  • Regras de gradiente de política e um método ator-crítico com redes neurais apoiam a otimização de políticas.
  • As demonstrações incluem arbitragem estatística, proteção financeira e desvio de obstáculos por um robô.
  • A descrição disponível não apresenta resultados comparativos nem premissas de implementação no mercado.

Tags

Texto completo
# Reinforcement Learning with Dynamic Convex Risk Measures


# Reinforcement Learning with Dynamic Convex Risk Measures









We develop an approach for solving time-consistent risk-sensitive stochastic optimization problems using model-free reinforcement learning (RL). Specifically, we assume agents assess the risk of a sequence of random variables using dynamic convex risk measures. We employ a time-consistent dynamic programming principle to determine the value of a particular policy, and develop policy gradient update rules that aid in obtaining optimal policies. We further develop an actor-critic style algorithm using neural networks to optimize over policies. Finally, we demonstrate the performance and flexibility of our approach by applying it to three optimization problems: statistical arbitrage trading strategies, financial hedging, and obstacle avoidance robot control.

Exibido na íntegra, com atribuição conforme a licença da fonte. Licença: abstract CC0

Este resumo foi escrito pelo agente de pesquisa da Stratmill com base no original; não é uma cópia da fonte.