یادگیری تقویتی عمیق برای معامله پویای جفت رمزارزها
خلاصه
این مطالعه یادگیری تقویتی عمیق را بهعنوان لایه اجرایی برای معامله جفتی در بازارهای پرنوسان رمزارز میآزماید. چارچوب ابتدا جفتهای نامزد را فیلتر و رتبهبندی میکند، سپس از عامل بهینهسازی سیاست مجاور با لایه حافظه بلندکوتاهمدت برای تصمیمگیری اجرایی استفاده میکند. طراحی میانگین تطبیقی با ریسک ثابت و کنترلهای ریسک قطعی، عامل را محدود میکنند و هدفشان کاهش ریسک واگرایی است. ارزیابی از دادههای ساعتی قراردادهای آتی Binance USD-M استفاده میکند و سیاست یادگرفتهشده را با یک مبنای اکتشافی مقایسه میکند.
نتایج خارج از نمونه گزارششده به نفع سیاست یادگیری تقویتی است و بوتاسترپ بلوکی دایرهای ایستا، عملکرد برتر تعدیلشده با ریسک را در سطح 10 درصد از نظر آماری معنادار نشان میدهد. نتیجه به آستانه معناداری سختگیرانهتر 5 درصد نمیرسد؛ مطالعه این موضوع را به واریانس ویژهدارایی بالای داراییهای دیجیتال نسبت میدهد. شواهد به دادهها و چیدمان آزمودهشده محدود است؛ توصیف، اندازه عملکرد، فرضهای هزینه معامله یا آزمون در محلها و دورههای دیگر را ارائه نمیکند. طراحی ترکیبی راهی برای محدودکردن تصمیمهای اجراییِ یادگرفتهشده فراهم میآورد، اما پایداری گستردهتر همچنان پرسشی باز است.
ایدههای کلیدی
- سامانه پیشنهادی، گزینش آماری جفتها را با یک لایه اجرایی یادگرفتهشده ترکیب میکند.
- یک عامل PPO همراه با LSTM، در چارچوب مرزهای ریسک قطعی تصمیمهای اجرایی میگیرد.
- مطالعه رویکرد را با دادههای ساعتی قراردادهای آتی Binance USD-M و در برابر یک مبنای اکتشافی ارزیابی میکند.
- عملکرد برتر تعدیلشده با ریسک در نتایج گزارششده در سطح 10 درصد معنادار است، اما در سطح 5 درصد معنادار نیست.
- نتایج به بازار، دادهها و پیکربندی استراتژی آزمودهشده محدودند.
برچسبها
متن کامل
# Dynamic Multi-Pair Trading Strategy in Cryptocurrency Markets with Deep Reinforcement Learning # Dynamic Multi-Pair Trading Strategy in Cryptocurrency Markets with Deep Reinforcement Learning This study aims to determine whether the application of Deep Reinforcement Learning (DRL) as a specialized execution overlay can enhance pair trading in highly volatile cryptocurrency markets. Although classical implementations of the strategy have proven successful in traditional equities, they frequently exhibit rigidity and suffer from severe divergence risks when applied to high-variance environments. To address this need, this research introduces novel concepts. To construct a robust system, we developed a hierarchical "Filter-then-Rank" pair selection methodology and a proprietary "Fixed Risk, Adaptive Mean" execution model. The system employs a Proximal Policy Optimization (PPO) agent with a Long Short-Term Memory (LSTM) layer to govern execution decisions within strict deterministic risk management boundaries. Evaluated on 1-hour interval data from the Binance USD-M Futures market, the optimized RL policy achieved an out-of-sample performance that substantially outperformed the heuristic baseline. A stationary circular block bootstrap robustness check confirms that the agent's risk-adjusted outperformance is statistically significant at the 10 percent level. Although falling marginally short of the stricter 5 percent threshold, this result highlights the extreme idiosyncratic variance characteristic of digital assets. Ultimately, this thesis contributes to the quantitative finance literature by introducing a hybrid architecture that combines statistical arbitrage with DRL execution policies. Furthermore, it delivers a novel framework for safe reinforcement learning via deterministic shielding, proving that anchoring a neural policy to statistically robust boundaries successfully mitigates severe divergence risks.
با ذکر منبع و مطابق مجوز اثر، بهطور کامل نمایش داده میشود. مجوز: abstract CC0
این خلاصه را عامل پژوهشی Stratmill بر پایه متن اصلی نوشته است؛ نسخهای از اثر منبع نیست.