Chuyển đến nội dung
Tất cả tài liệu trong thư viện

Học tăng cường vững chắc, xét đến rủi ro cho chiến lược danh mục

Bài viết arXiv papers · Tác giả: Sebastian Jaimungal et al.

Tóm tắt

Công trình này phát triển phương pháp học tăng cường để tối ưu hóa chính sách theo tiêu chí hiệu suất có xét đến rủi ro. Phương pháp đánh giá chính sách bằng tiện ích kỳ vọng phụ thuộc thứ hạng, cho phép một tác nhân thể hiện các mức ưu tiên khác nhau đối với lợi nhuận và kết quả bất lợi. Để xử lý bất định mô hình, chính sách được đánh giá theo phân phối lợi suất trường hợp xấu nhất trong một vùng cầu Wasserstein quanh phân phối được mô hình hóa. Điều này tạo ra bài toán quyết định lồng nhau: tác nhân chọn chính sách, sau đó một đối thủ chọn phân phối lân cận làm giảm hiệu suất của chính sách.

Các tác giả suy ra công thức gradient chính sách cho cả bài toán chọn chính sách và bài toán phân phối đối kháng. Họ minh họa phương pháp bằng phân bổ danh mục vững chắc, tối ưu hóa chuẩn đối chiếu và kinh doanh chênh lệch thống kê. Các ứng dụng này cho thấy phạm vi dự kiến của khung phương pháp, nhưng tài liệu không đưa ra số liệu hiệu suất so sánh, chi tiết dữ liệu thị trường hay hướng dẫn triển khai thực tế. Do đó, tính hữu ích phụ thuộc vào việc kiểm định thêm mô hình, tập bất định và mức độ chấp nhận rủi ro trong một bối cảnh giao dịch cụ thể.

Ý chính

  • Tiện ích kỳ vọng phụ thuộc thứ hạng cho phép chính sách mã hóa các mức đánh đổi khác nhau giữa lợi nhuận và rủi ro giảm giá.
  • Khung phương pháp đánh giá từng chính sách trước phân phối trường hợp xấu nhất trong lân cận Wasserstein.
  • Bài toán bên trong theo hướng đối kháng tìm phân phối làm giảm hiệu suất của chính sách đã chọn.
  • Các tác giả suy ra gradient chính sách cho cả bài toán tối ưu hóa chính sách và bài toán đối kháng.
  • Các minh họa bao gồm phân bổ danh mục, tối ưu hóa chuẩn đối chiếu và kinh doanh chênh lệch thống kê.

Thẻ

Toàn văn
# Robust Risk-Aware Reinforcement Learning


# Robust Risk-Aware Reinforcement Learning









We present a reinforcement learning (RL) approach for robust optimisation of risk-aware performance criteria. To allow agents to express a wide variety of risk-reward profiles, we assess the value of a policy using rank dependent expected utility (RDEU). RDEU allows the agent to seek gains, while simultaneously protecting themselves against downside risk. To robustify optimal policies against model uncertainty, we assess a policy not by its distribution, but rather, by the worst possible distribution that lies within a Wasserstein ball around it. Thus, our problem formulation may be viewed as an actor/agent choosing a policy (the outer problem), and the adversary then acting to worsen the performance of that strategy (the inner problem). We develop explicit policy gradient formulae for the inner and outer problems, and show its efficacy on three prototypical financial problems: robust portfolio allocation, optimising a benchmark, and statistical arbitrage.

Hiển thị toàn văn kèm ghi nguồn theo giấy phép của tài liệu gốc. Giấy phép: abstract CC0

Bản tóm tắt này do tác nhân nghiên cứu của Stratmill biên soạn từ tài liệu gốc; đây không phải bản sao của tài liệu.