مواد پر جائیں
لائبریری کی تمام دستاویزات

اختتامی نیلامی والی مارکیٹوں کے لیے تصفیے کی پالیسیاں سیکھنا

مضمون arXiv papers · مصنف: Julius Graf et al.

خلاصہ

یہ مطالعہ ایسے ٹریڈر کا جائزہ لیتا ہے جو لمٹ آرڈر بک کے ذریعے فروخت کرتا ہے اور پھر اختتامی نیلامی میں سمت اور مقدار کے نشان والے شیڈولز سے باقی انوینٹری کو ایڈجسٹ کرتا ہے۔ دونوں مراحل نیلامی کی تصفیہ قیمت کی پیش گوئی اور نیلامی کے دوران ملنے والے ردعمل سے جڑے ہیں۔ مصنفین نقلی مارکیٹ میں ڈیپ کیو نیٹ ورکس کا موازنہ پروجیکٹڈ DDPG، TD3 اور SAC ری انفورسمنٹ لرننگ پالیسیوں سے کرتے ہیں، جس میں مصنوعی رف ہیسٹن قیمتیں اور تاریخی درمیانی قیمت کے راستے استعمال ہوتے ہیں۔

انوینٹری کے جرمانے کے ساتھ عمل درآمد کی کمی کے پیمانے سے پالیسیوں کا انتخاب اور جائزہ لیا جاتا ہے، جبکہ جانچ کو وزن دار تربیتی مقصد سے الگ رکھا گیا ہے۔ سیکھے گئے طریقوں نے رپورٹ شدہ نقلی تجربات میں ایویلانیڈا–ستویکوف اور TWAP کے حوالہ جاتی طریقوں سے کم جرمانہ شدہ کمی حاصل کی۔ مماثل مصنوعی موازنوں سے یہ بھی اشارہ ملتا ہے کہ نیلامی تک رسائی چاروں سیکھنے کے طریقوں کی مدد کرتی ہے۔ نیلامی سے زیادہ بار ردعمل ملنے پر سیکھنے میں بہتری آتی ہے، جبکہ تصفیہ قیمت کی پیش گوئی کی اضافی فیصلہ جاتی قدر سیکھنے کے طریقے کے لحاظ سے بدلتی ہے۔ یہ نتائج نقلی تجربات پر مبنی ہیں؛ وضاحت حقیقی ٹریڈنگ میں کارکردگی یا دوسری مارکیٹ حالتوں میں عمومیت ثابت نہیں کرتی۔

اہم خیالات

  • تصفیے کا عمل مسلسل لمٹ آرڈر ٹریڈنگ کو اختتامی نیلامی کے ساتھ ملاتا ہے۔
  • نیلامی کے شیڈول مسلسل ٹریڈنگ کے بعد باقی انوینٹری کو ایڈجسٹ کرتے ہیں۔
  • مصنوعی قیمتوں اور تاریخی درمیانی قیمت کے راستوں سے ری انفورسمنٹ لرننگ کے چار طریقوں کا موازنہ کیا گیا ہے۔
  • سیکھے گئے طریقوں میں ایویلانیڈا–ستویکوف اور TWAP حوالوں سے کم انوینٹری جرمانہ شدہ کمی رپورٹ ہوئی۔
  • مماثل مصنوعی موازنوں میں نیلامی تک رسائی ہر طریقے کی مدد کرتی ہے، جبکہ پیش گوئی کی قدر طریقے کے لحاظ سے بدلتی ہے۔

ٹیگز

مکمل متن
# Learning Optimal Liquidation with Closing Auctions


# Learning Optimal Liquidation with Closing Auctions









We study liquidation when continuous trading is followed by a closing auction. The trader first sells through a limit-order book, then submits signed auction schedules to adjust the remaining inventory. A projected clearing price signal and intermediate auction feedback connect the two phases. We compare deep Q-network (DQN) policies with projected deep deterministic policy gradient (DDPG), twin delayed deep deterministic policy gradient (TD3) and soft actor-critic (SAC) policies, using synthetic rough Heston prices and historical midprice paths within a simulated market. Policies are selected and evaluated by inventory-penalized implementation shortfall, separately from a weighted training objective. They achieve lower inventory-penalized shortfall than the stylized Avellaneda-Stoikov (AS) and time-weighted average price (TWAP) references, and matched synthetic comparisons show that auction access is useful for all four learners. We furthermore find that dense auction credit improves learning; the clearing forecast is informative, but its incremental decision value is learner-dependent.

ماخذ کا حوالہ دیتے ہوئے مکمل متن دکھایا گیا ہے، ماخذ کے لائسنس کے تحت۔ لائسنس: abstract CC0

یہ خلاصہ اصل ماخذ سے Stratmill کے تحقیقی ایجنٹ نے لکھا ہے؛ یہ ماخذ کی نقل نہیں۔