مواد پر جائیں
لائبریری کی تمام دستاویزات

جوڑی ٹریڈنگ کے لیے درجہ وار لینگویج ماڈل ری اِنفورسمنٹ لرننگ

مضمون arXiv papers · مصنف: Polydoros Giannouris et al.

خلاصہ

یہ کام جوڑی ٹریڈنگ کو دو مربوط مراحل پر مشتمل درجہ وار فیصلہ سازی کے مسئلے کے طور پر پیش کرتا ہے: طویل افق پر اثاثوں کا جوڑا منتخب کرنا اور جزوی مشاہدے کے تحت مختصر افق پر ٹریڈز پر عمل درآمد کرنا۔ چونکہ فیڈبیک تاخیر سے ملتا ہے اور مبہم ہو سکتا ہے، خراب نتائج جوڑے کے انتخاب، عمل درآمد کی پالیسی یا دونوں سے پیدا ہو سکتے ہیں۔ مجوزہ طریقہ دونوں سطحوں پر بڑے لینگویج ماڈلز کو پالیسیوں کے طور پر استعمال کرتا ہے اور گریڈینٹ پر مبنی فائن ٹیوننگ کے بجائے پرامپٹ کی تازہ کاریوں سے انہیں ڈھالتا ہے۔

ٹریجیکٹری اور ایپی سوڈ کی سطحوں پر متنی فیڈبیک، جوڑے کے انتخاب کے تجریدی فیصلوں اور عمل درآمد کے رویے کو الگ الگ درست کرنے کے لیے استعمال ہوتا ہے۔ مصنفین کا کہنا ہے کہ یہ علیحدگی کارکردگی میں تبدیلی کے ذرائع کو الگ شناخت کرنے میں مدد دیتی ہے اور پالیسی کی دونوں سطحوں کے درمیان عدم استحکام کم کرتی ہے۔ حقیقی دنیا کے مارکیٹ ڈیٹا پر تجربات میں روایتی اور LLM پر مبنی بنیادی طریقوں سے مستقل بہتری کی اطلاع دی گئی ہے۔ دستاویز ڈیٹاسیٹس، ٹریڈنگ لاگت، خطرے کے کنٹرول یا جانچ کے ڈیزائن کی وضاحت نہیں کرتی، اس لیے صرف اس بیان سے حقیقی ٹریڈنگ کے لیے موزونیت یا نتائج کی عمومیت کا اندازہ نہیں لگایا جا سکتا۔

اہم خیالات

  • یہ طریقہ طویل افق پر جوڑا منتخب کرنے کو مختصر افق پر ٹریڈ پر عمل درآمد سے الگ کرتا ہے۔
  • بڑے لینگویج ماڈلز ٹریڈنگ کے درجہ وار نظام کی دونوں سطحوں پر پالیسیوں کے طور پر کام کرتے ہیں۔
  • پرامپٹ کی تازہ کاریاں گریڈینٹ پر مبنی فائن ٹیوننگ کے بغیر متنی فیڈبیک سے پالیسیوں کو ڈھالتی ہیں۔
  • حقیقی مارکیٹ ڈیٹا پر تجربات میں روایتی اور LLM پر مبنی بنیادی طریقوں سے بہتر نتائج کی اطلاع دی گئی ہے، اگرچہ جانچ کی تفصیلات نہیں دی گئیں۔

ٹیگز

مکمل متن
# Moira: Language-driven Hierarchical Reinforcement Learning for Pair Trading


# Moira: Language-driven Hierarchical Reinforcement Learning for Pair Trading









Many sequential decision-making problems exhibit hierarchical structure, where high-level semantic choices constrain downstream actions and feedback is delayed and ambiguous. Learning in such settings is challenging due to credit assignment: performance degradation may arise from flawed abstractions, suboptimal execution, or their interaction. We study this challenge through pair trading, a domain that naturally combines long-horizon semantic reasoning for asset pair selection with short-horizon execution under partial observability. We formulate pair trading as a hierarchical reinforcement learning problem and propose a language-driven optimization framework in which both high-level and low-level policies are parameterized by large language models (LLMs) and optimized exclusively through prompt updates. Our approach leverages pretrained LLMs as hierarchical policies and uses trajectory- and episode-level textual feedback to adapt abstractions and execution without gradient-based fine-tuning. By explicitly separating abstraction selection from execution, the framework reduces non-stationarity across hierarchical levels and enables targeted adaptation under delayed feedback. Experiments on real-world market data show consistent improvements over traditional and LLM-based baselines, demonstrating the effectiveness of language-driven hierarchical reinforcement learning.

ماخذ کا حوالہ دیتے ہوئے مکمل متن دکھایا گیا ہے، ماخذ کے لائسنس کے تحت۔ لائسنس: abstract CC0

یہ خلاصہ اصل ماخذ سے Stratmill کے تحقیقی ایجنٹ نے لکھا ہے؛ یہ ماخذ کی نقل نہیں۔