مواد پر جائیں
لائبریری کی تمام دستاویزات

اثاثہ قیمت بندی کے عوامل کے لیے سیاق و سباق سے آگاہ خبروں کے موضوعات

مضمون arXiv papers · مصنف: Kevin Foley et al.

خلاصہ

یہ مطالعہ جانچتا ہے کہ آیا جملے کی سطح کا سیاق و سباق خبروں کے موضوعاتی ماڈلز کو بہتر کرتا ہے، جو قاعدہ بند سرمایہ کاری کے لیے اثاثہ قیمت بندی کے عوامل بنانے میں استعمال ہوتے ہیں۔ یہ لیٹنٹ ڈیریشلے ایلوکیشن کا موازنہ منجمد جملہ ٹرانسفارمر کے بعد کے کے مینز کلسٹرنگ سے کرتا ہے؛ دونوں میں 394,661 مضامین کا ایک ہی مجموعہ اور بعد کا پورٹ فولیو سازی کا عمل استعمال ہوا۔ دونوں طریقے مضمون کے متن کی مقدار اور موضوعاتی اصطلاحات کی درجہ بندی میں بھی مختلف ہیں۔

ٹرانسفارمر طریقے نے NPMI سے ناپی گئی موضوعاتی ہم آہنگی اور پورٹ فولیو کے شارپ اسکورز زیادہ ریکارڈ کیے، لیکن دستیاب ٹیسٹ یہ ثابت نہیں کرتے کہ وہ LDA سے بہتر ہے۔ کروی کلسٹرنگ اور متعدد مدتوں کے ایکسپوژرز والے تحقیقی نسخوں نے اضافی منافع کا 1.03 شارپ رکھنے والا مشترکہ ماڈل پیدا کیا۔ نتائج سے اشارہ ملتا ہے کہ سیاق و سباق سے آگاہ نمائندگیاں خبروں سے مالی طور پر مفید اشارے اخذ کرنے میں مدد دے سکتی ہیں۔ اعتماد محدود ہے: مطالعہ زیادہ سخت ٹیسٹوں کا تقاضا کرتا ہے جن میں ہر تاریخ پر صرف دستیاب معلومات استعمال ہوں، اور وسیع تر ڈیٹاسیٹس پر جانچ کی جائے۔

اہم خیالات

  • مطالعہ LDA کے لیٹنٹ ڈیریشلے ایلوکیشن موضوعات کا موازنہ جملہ ٹرانسفارمر ایمبیڈنگز سے کے مینز کلسٹرنگ کے ذریعے بنائے گئے موضوعات سے کرتا ہے۔
  • رپورٹ شدہ تجزیے میں ٹرانسفارمر طریقے کے موضوعاتی ہم آہنگی اور پورٹ فولیو شارپ اسکور دونوں زیادہ تھے۔
  • موازنے میں مضامین کا ایک ہی مجموعہ اور بعد کا پورٹ فولیو سازی کا عمل استعمال ہوتا ہے، اگرچہ متن کے ان پٹ اور اصطلاحات کی درجہ بندی مختلف ہیں۔
  • تحقیقی کروی کلسٹرنگ اور متعدد مدتوں کے ایکسپوژرز نے مشترکہ ماڈل کے لیے اضافی منافع کا 1.03 شارپ دیا۔
  • شواہد فیصلہ کن نہیں؛ ہر تاریخ پر دستیاب معلومات استعمال کرنے والی جانچ اور وسیع تر ڈیٹاسیٹس درکار ہیں۔

ٹیگز

مکمل متن
# From Word Counts to Context: Topic Models for Asset Pricing


# From Word Counts to Context: Topic Models for Asset Pricing









News may reveal systematic risk, but whether its context enhances the construction of systematic risk factors is still unclear. We seek to test whether utilizing a sentence transformer represents an improvement over techniques such as Latent Dirichlet Allocation (LDA) in the coherence of topic term lists generated from unstructured text data. To test this, the same collection of unstructured text data comprising of 394,661 articles and the same downstream financial portfolio construction pipeline were applied with the text layer differing, including the length of article text each model used and how topic terms were ranked: we benchmark LDA against a frozen sentence transformer with k-means clustering. We find that the sentence transformer branch had higher observed scores both in terms of coherence (measured by NPMI) as well as financial performance (measured by Sharpe), although the available tests do not establish outperformance. Further exploratory specifications such as utilizing spherical clustering and multi-horizon exposures had an observed excess-return Sharpe of 1.03 for the combined model. We believe that there is some promise in applying context-aware techniques on unstructured news text, but stricter tests using only information available at each date and broader datasets may be required to enhance the confidence in the observed performance.

ماخذ کا حوالہ دیتے ہوئے مکمل متن دکھایا گیا ہے، ماخذ کے لائسنس کے تحت۔ لائسنس: abstract CC0

یہ خلاصہ اصل ماخذ سے Stratmill کے تحقیقی ایجنٹ نے لکھا ہے؛ یہ ماخذ کی نقل نہیں۔