본문으로 건너뛰기
라이브러리 문서 전체

포트폴리오 전략을 위한 강건한 위험 인식 강화학습

기사 arXiv papers · 저자: Sebastian Jaimungal et al.

요약

이 연구는 위험을 고려한 성과 기준에 따라 정책을 최적화하는 강화학습 접근법을 개발한다. 정책을 순위 의존 기대효용으로 평가해 에이전트가 수익과 하방 결과에 대해 서로 다른 선호를 표현할 수 있게 한다. 모델 불확실성에 대응하기 위해 모델링된 분포를 중심으로 한 바서슈타인 거리 구 안에서 최악의 수익률 분포를 기준으로 정책을 평가한다. 이에 따라 에이전트가 정책을 선택한 뒤 적대자가 성과를 낮추는 주변 분포를 고르는 중첩 의사결정 문제가 생긴다.

저자들은 정책 선택과 적대적 분포 문제 모두에 대한 정책 그래디언트 공식을 도출한다. 강건한 포트폴리오 배분, 벤치마크 최적화, 통계적 차익거래에 이 방법을 적용해 보인다. 이러한 적용 사례는 프레임워크의 의도된 범위를 보여주지만, 문서에는 비교 성과 수치, 시장 데이터 세부사항, 실용적인 구현 지침이 없다. 따라서 특정 트레이딩 환경에서 유용성을 판단하려면 모델과 불확실성 집합, 위험 선호를 추가로 검증해야 한다.

핵심 아이디어

  • 순위 의존 기대효용으로 정책이 수익과 하방 위험 사이의 여러 절충을 반영할 수 있다.
  • 이 프레임워크는 바서슈타인 근방의 최악의 분포를 기준으로 각 정책을 평가한다.
  • 내부의 적대적 문제는 선택된 정책의 성과를 낮추는 분포를 찾는다.
  • 저자들은 정책 최적화와 적대적 문제 모두에 대한 정책 그래디언트를 도출한다.
  • 포트폴리오 배분, 벤치마크 최적화, 통계적 차익거래 사례를 제시한다.

태그

전문
# Robust Risk-Aware Reinforcement Learning


# Robust Risk-Aware Reinforcement Learning









We present a reinforcement learning (RL) approach for robust optimisation of risk-aware performance criteria. To allow agents to express a wide variety of risk-reward profiles, we assess the value of a policy using rank dependent expected utility (RDEU). RDEU allows the agent to seek gains, while simultaneously protecting themselves against downside risk. To robustify optimal policies against model uncertainty, we assess a policy not by its distribution, but rather, by the worst possible distribution that lies within a Wasserstein ball around it. Thus, our problem formulation may be viewed as an actor/agent choosing a policy (the outer problem), and the adversary then acting to worsen the performance of that strategy (the inner problem). We develop explicit policy gradient formulae for the inner and outer problems, and show its efficacy on three prototypical financial problems: robust portfolio allocation, optimising a benchmark, and statistical arbitrage.

출처의 라이선스에 따라 출처를 표시하고 전문을 공개합니다. 라이선스: abstract CC0

이 요약은 원문을 바탕으로 Stratmill의 리서치 에이전트가 작성했으며, 원문을 복사한 것이 아닙니다.