Học tăng cường để quản lý danh mục tiền mã hóa
Tóm tắt
Bài báo đề xuất sử dụng Soft Actor-Critic (SAC) và Deep Deterministic Policy Gradient (DDPG) để quản lý danh mục tiền mã hóa. Các tác nhân học các hành động giao dịch liên tục trong môi trường mô phỏng bằng dữ liệu thị trường lịch sử, điều chỉnh tỷ trọng danh mục nhằm tìm kiếm lợi nhuận tích lũy đồng thời tính đến rủi ro giảm giá và chi phí giao dịch. SAC sử dụng mục tiêu được điều chuẩn entropy, mà bài báo cho là giúp tăng tính ổn định trong điều kiện nhiễu.
Các thử nghiệm trên nhiều loại tiền mã hóa báo cáo rằng cả hai tác nhân đều vượt các mốc danh mục tỷ trọng bằng nhau và phương sai trung bình, trong đó SAC ổn định và vững hơn DDPG. Phần tóm tắt không nêu tài sản, giai đoạn mẫu, giả định thị trường, mô hình chi phí giao dịch hay kết quả bằng số. Vì bằng chứng đến từ đánh giá thử nghiệm trên dữ liệu lịch sử và môi trường mô phỏng, bản thân nó không cho thấy các phương pháp sẽ đạt kết quả tương tự trong giao dịch thực hoặc dưới các điều kiện thị trường khác.
Ý chính
- Các tác nhân SAC và DDPG học hành động danh mục liên tục từ dữ liệu thị trường lịch sử trong môi trường mô phỏng.
- Các tác nhân điều chỉnh tỷ trọng danh mục trong khi cân nhắc lợi nhuận, rủi ro giảm giá và chi phí giao dịch.
- Bài báo báo cáo hiệu suất tốt hơn các mốc tỷ trọng bằng nhau và phương sai trung bình trên nhiều loại tiền mã hóa.
- SAC được báo cáo là ổn định hơn DDPG trong điều kiện thị trường nhiều nhiễu.
- Phần tóm tắt không cung cấp thiết lập thử nghiệm hoặc chi tiết hiệu suất bằng số.
Thẻ
Toàn văn
# 2511.20678 # Cryptocurrency Portfolio Management with Reinforcement Learning: Soft Actor--Critic and Deep Deterministic Policy Gradient Algorithms This paper proposes a reinforcement learning--based framework for cryptocurrency portfolio management using the Soft Actor--Critic (SAC) and Deep Deterministic Policy Gradient (DDPG) algorithms. Traditional portfolio optimization methods often struggle to adapt to the highly volatile and nonlinear dynamics of cryptocurrency markets. To address this, we design an agent that learns continuous trading actions directly from historical market data through interaction with a simulated trading environment. The agent optimizes portfolio weights to maximize cumulative returns while minimizing downside risk and transaction costs. Experimental evaluations on multiple cryptocurrencies demonstrate that the SAC and DDPG agents outperform baseline strategies such as equal-weighted and mean--variance portfolios. The SAC algorithm, with its entropy-regularized objective, shows greater stability and robustness in noisy market conditions compared to DDPG. These results highlight the potential of deep reinforcement learning for adaptive and data-driven portfolio management in cryptocurrency markets.
Hiển thị toàn văn kèm ghi nguồn theo giấy phép của tài liệu gốc. Giấy phép: abstract CC0
Bản tóm tắt này do tác nhân nghiên cứu của Stratmill biên soạn từ tài liệu gốc; đây không phải bản sao của tài liệu.