رفتن به محتوا
همه اسناد کتابخانه

یادگیری تقویتی عمیق برای معامله پویای جفت رمزارزها

مقاله arXiv papers · نویسنده: Damian Lebiedź et al.

خلاصه

این مطالعه یادگیری تقویتی عمیق را به‌عنوان لایه اجرایی برای معامله جفتی در بازارهای پرنوسان رمزارز می‌آزماید. چارچوب ابتدا جفت‌های نامزد را فیلتر و رتبه‌بندی می‌کند، سپس از عامل بهینه‌سازی سیاست مجاور با لایه حافظه بلندکوتاه‌مدت برای تصمیم‌گیری اجرایی استفاده می‌کند. طراحی میانگین تطبیقی با ریسک ثابت و کنترل‌های ریسک قطعی، عامل را محدود می‌کنند و هدفشان کاهش ریسک واگرایی است. ارزیابی از داده‌های ساعتی قراردادهای آتی Binance USD-M استفاده می‌کند و سیاست یادگرفته‌شده را با یک مبنای اکتشافی مقایسه می‌کند.

نتایج خارج از نمونه گزارش‌شده به نفع سیاست یادگیری تقویتی است و بوت‌استرپ بلوکی دایره‌ای ایستا، عملکرد برتر تعدیل‌شده با ریسک را در سطح 10 درصد از نظر آماری معنادار نشان می‌دهد. نتیجه به آستانه معناداری سخت‌گیرانه‌تر 5 درصد نمی‌رسد؛ مطالعه این موضوع را به واریانس ویژه‌دارایی بالای دارایی‌های دیجیتال نسبت می‌دهد. شواهد به داده‌ها و چیدمان آزموده‌شده محدود است؛ توصیف، اندازه عملکرد، فرض‌های هزینه معامله یا آزمون در محل‌ها و دوره‌های دیگر را ارائه نمی‌کند. طراحی ترکیبی راهی برای محدودکردن تصمیم‌های اجراییِ یادگرفته‌شده فراهم می‌آورد، اما پایداری گسترده‌تر همچنان پرسشی باز است.

ایده‌های کلیدی

  • سامانه پیشنهادی، گزینش آماری جفت‌ها را با یک لایه اجرایی یادگرفته‌شده ترکیب می‌کند.
  • یک عامل PPO همراه با LSTM، در چارچوب مرزهای ریسک قطعی تصمیم‌های اجرایی می‌گیرد.
  • مطالعه رویکرد را با داده‌های ساعتی قراردادهای آتی Binance USD-M و در برابر یک مبنای اکتشافی ارزیابی می‌کند.
  • عملکرد برتر تعدیل‌شده با ریسک در نتایج گزارش‌شده در سطح 10 درصد معنادار است، اما در سطح 5 درصد معنادار نیست.
  • نتایج به بازار، داده‌ها و پیکربندی استراتژی آزموده‌شده محدودند.

برچسب‌ها

متن کامل
# Dynamic Multi-Pair Trading Strategy in Cryptocurrency Markets with Deep Reinforcement Learning


# Dynamic Multi-Pair Trading Strategy in Cryptocurrency Markets with Deep Reinforcement Learning









This study aims to determine whether the application of Deep Reinforcement Learning (DRL) as a specialized execution overlay can enhance pair trading in highly volatile cryptocurrency markets. Although classical implementations of the strategy have proven successful in traditional equities, they frequently exhibit rigidity and suffer from severe divergence risks when applied to high-variance environments. To address this need, this research introduces novel concepts. To construct a robust system, we developed a hierarchical "Filter-then-Rank" pair selection methodology and a proprietary "Fixed Risk, Adaptive Mean" execution model. The system employs a Proximal Policy Optimization (PPO) agent with a Long Short-Term Memory (LSTM) layer to govern execution decisions within strict deterministic risk management boundaries. Evaluated on 1-hour interval data from the Binance USD-M Futures market, the optimized RL policy achieved an out-of-sample performance that substantially outperformed the heuristic baseline. A stationary circular block bootstrap robustness check confirms that the agent's risk-adjusted outperformance is statistically significant at the 10 percent level. Although falling marginally short of the stricter 5 percent threshold, this result highlights the extreme idiosyncratic variance characteristic of digital assets. Ultimately, this thesis contributes to the quantitative finance literature by introducing a hybrid architecture that combines statistical arbitrage with DRL execution policies. Furthermore, it delivers a novel framework for safe reinforcement learning via deterministic shielding, proving that anchoring a neural policy to statistically robust boundaries successfully mitigates severe divergence risks.

با ذکر منبع و مطابق مجوز اثر، به‌طور کامل نمایش داده می‌شود. مجوز: abstract CC0

این خلاصه را عامل پژوهشی Stratmill بر پایه متن اصلی نوشته است؛ نسخه‌ای از اثر منبع نیست.