본문으로 건너뛰기
라이브러리 문서 전체

동적 볼록 위험 측정을 이용한 정책 경사 강화학습

기사 arXiv papers · 저자: Anthony Coache et al.

요약

이 문서는 결과를 동적 볼록 위험 측정치로 평가하는 순차 최적화용 모델 비의존 강화학습 방법을 제시합니다. 시간 일관적인 동적 계획 원리로 정책의 가치를 평가한 뒤, 더 나은 정책을 찾기 위한 정책 경사 갱신 규칙을 도출합니다. 신경망을 활용한 액터-크리틱 접근법으로 정책을 최적화하는 방안을 제안합니다.

이 방법은 통계적 차익거래, 금융 헤지, 로봇의 장애물 회피 제어라는 세 가지 과제에서 시연됩니다. 이는 금융 및 비금융 분야 모두에 프레임워크를 적용했음을 보여주지만, 설명에는 성과 수치, 비교 방법, 시장 가정, 구현 세부 사항이 없습니다. 따라서 최적화 구조와 적용 범위는 제시하지만, 트레이딩 효과와 실용적 한계에 관한 증거는 명시되지 않았습니다.

핵심 아이디어

  • 동적 볼록 위험 측정치는 불확실한 결과의 연속을 평가하는 방법을 제공합니다.
  • 후보 정책의 가치를 평가하는 데 시간 일관적인 동적 계획법을 사용합니다.
  • 정책 경사 규칙과 신경망 액터-크리틱 방법으로 정책을 최적화합니다.
  • 통계적 차익거래, 금융 헤지, 로봇 장애물 회피를 시연 과제로 다룹니다.
  • 제공된 설명에는 비교 결과나 시장 구현 가정이 없습니다.

태그

전문
# Reinforcement Learning with Dynamic Convex Risk Measures


# Reinforcement Learning with Dynamic Convex Risk Measures









We develop an approach for solving time-consistent risk-sensitive stochastic optimization problems using model-free reinforcement learning (RL). Specifically, we assume agents assess the risk of a sequence of random variables using dynamic convex risk measures. We employ a time-consistent dynamic programming principle to determine the value of a particular policy, and develop policy gradient update rules that aid in obtaining optimal policies. We further develop an actor-critic style algorithm using neural networks to optimize over policies. Finally, we demonstrate the performance and flexibility of our approach by applying it to three optimization problems: statistical arbitrage trading strategies, financial hedging, and obstacle avoidance robot control.

출처의 라이선스에 따라 출처를 표시하고 전문을 공개합니다. 라이선스: abstract CC0

이 요약은 원문을 바탕으로 Stratmill의 리서치 에이전트가 작성했으며, 원문을 복사한 것이 아닙니다.