본문으로 건너뛰기
라이브러리 문서 전체

매매 강화학습의 볼록 위험 목표

기사 arXiv papers · 저자: Shanyu Han et al.

요약

이 논문은 볼록 점수 함수로 표현한 위험 목표를 가진 의사결정 문제를 위한 강화학습 프레임워크를 제시합니다. 분산, 기대손실(Expected Shortfall), 엔트로피 위험가치(Value-at-Risk), 평균·위험 효용 등의 척도를 표현할 수 있습니다. 시간에 따라 이러한 목표를 실행 가능하게 만드는 데 초점을 둡니다. 위험 최적화는 시간 불일치를 일으킬 수 있으며, 이전 시점에 선호했던 정책이 나중 의사결정 시점에는 더 이상 선호되지 않을 수 있습니다.

이를 해결하기 위해 저자들은 보조 변수를 상태에 추가하고 문제를 두 상태 최적화로 재구성합니다. 맞춤형 액터-크리틱 알고리즘, 연속 마르코프 의사결정 과정이 필요하지 않은 이론적 근사 보장, 교대 최소화에서 착안한 보조 변수 샘플링 절차를 설명합니다. 논문은 통계적 차익거래 적용 사례를 포함한 시뮬레이션 실험을 방법의 효과에 대한 근거로 보고합니다. 제공된 설명에는 수치 결과나 상세한 실험 설정이 없고, 샘플링 방법의 수렴은 명시된 가정에 달려 있습니다. 따라서 시험된 시뮬레이션을 넘어선 실용적 성과는 불분명합니다.

핵심 아이디어

  • 볼록 점수 함수는 강화학습 목표에서 여러 익숙한 위험 척도를 표현할 수 있습니다.
  • 보조 변수를 상태에 추가하면 위험 민감 의사결정의 시간 불일치 문제를 다루는 데 도움이 됩니다.
  • 제안된 액터-크리틱 방법에는 연속 상태 과정이 필요하지 않은 근사 보장이 따릅니다.
  • 교대 최소화에서 착안한 샘플링 방법은 특정 조건에서 수렴한다고 보고됩니다.
  • 시뮬레이션 실험에는 통계적 차익거래 매매 적용 사례가 포함됩니다.

태그

전문
# Risk-sensitive Reinforcement Learning Based on Convex Scoring Functions


# Risk-sensitive Reinforcement Learning Based on Convex Scoring Functions









We propose a reinforcement learning (RL) framework under a broad class of risk objectives, characterized by convex scoring functions. This class covers many common risk measures, such as variance, Expected Shortfall, entropic Value-at-Risk, and mean-risk utility. To resolve the time-inconsistency issue, we consider an augmented state space and an auxiliary variable and recast the problem as a two-state optimization problem. We propose a customized Actor-Critic algorithm and establish some theoretical approximation guarantees. A key theoretical contribution is that our results do not require the Markov decision process to be continuous. Additionally, we propose an auxiliary variable sampling method inspired by the alternating minimization algorithm, which is convergent under certain conditions. We validate our approach in simulation experiments with a financial application in statistical arbitrage trading, demonstrating the effectiveness of the algorithm.

출처의 라이선스에 따라 출처를 표시하고 전문을 공개합니다. 라이선스: abstract CC0

이 요약은 원문을 바탕으로 Stratmill의 리서치 에이전트가 작성했으며, 원문을 복사한 것이 아닙니다.