رفتن به محتوا
همه اسناد کتابخانه

موضوعات خبری آگاه از بافت برای عوامل قیمت‌گذاری دارایی

مقاله arXiv papers · نویسنده: Kevin Foley et al.

خلاصه

این مطالعه می‌آزماید که آیا بافت جمله‌ای مدل‌های موضوعی اخبار را که برای ساخت عوامل نظام‌مند قیمت‌گذاری دارایی به کار می‌روند بهبود می‌دهد یا نه. تخصیص پنهان دیریکله را با یک تبدیل‌گر جمله‌ای که وزن‌های آن ثابت نگه داشته شده‌اند و سپس خوشه‌بندی ‏k-means مقایسه می‌کند؛ هر دو از مجموعه یکسانی شامل 394,661 مقاله و فرایند یکسان ساخت سبد در مرحله بعد استفاده می‌کنند. این رویکردها از نظر میزان متن مقاله مورد استفاده و روش رتبه‌بندی واژه‌های موضوعی نیز تفاوت دارند.

رویکرد تبدیل‌گر هم‌خوانی موضوعی بالاتری، بر اساس NPMI، و امتیازهای شارپ سبد بالاتری ثبت کرد؛ اما آزمون‌های موجود نشان نمی‌دهند که از LDA بهتر است. نسخه‌های اکتشافی با خوشه‌بندی کروی و مواجهه در افق‌های چندگانه، مدلی ترکیبی با شارپ بازده مازاد 1.03 ایجاد کردند. یافته‌ها نشان می‌دهند بازنمایی‌های آگاه از بافت ممکن است به استخراج سیگنال‌های مالی سودمند از اخبار کمک کنند. میزان اطمینان همچنان محدود است: مطالعه خواستار آزمون‌های سخت‌گیرانه‌تری است که ورودی‌ها را به اطلاعات در دسترس در هر تاریخ محدود کنند و ارزیابی را روی مجموعه‌داده‌های گسترده‌تر انجام دهند.

ایده‌های کلیدی

  • مطالعه موضوعات LDA را با موضوعات حاصل از تعبیه‌های تبدیل‌گر جمله‌ای که با ‏k-means خوشه‌بندی شده‌اند مقایسه می‌کند.
  • در تحلیل گزارش‌شده، هم هم‌خوانی موضوعی و هم امتیازهای شارپ سبد برای رویکرد تبدیل‌گر بالاتر بود.
  • مقایسه از مجموعه مقالات و خط لوله ساخت سبد یکسانی استفاده می‌کند، هرچند ورودی متنی و رتبه‌بندی واژه‌ها متفاوت است.
  • خوشه‌بندی کروی اکتشافی و مواجهه‌های چندافقی برای مدل ترکیبی شارپ بازده مازاد 1.03 به همراه داشتند.
  • شواهد قطعی نیستند و به آزمون‌های نقطه‌درزمان و مجموعه‌داده‌های گسترده‌تر نیاز است.

برچسب‌ها

متن کامل
# From Word Counts to Context: Topic Models for Asset Pricing


# From Word Counts to Context: Topic Models for Asset Pricing









News may reveal systematic risk, but whether its context enhances the construction of systematic risk factors is still unclear. We seek to test whether utilizing a sentence transformer represents an improvement over techniques such as Latent Dirichlet Allocation (LDA) in the coherence of topic term lists generated from unstructured text data. To test this, the same collection of unstructured text data comprising of 394,661 articles and the same downstream financial portfolio construction pipeline were applied with the text layer differing, including the length of article text each model used and how topic terms were ranked: we benchmark LDA against a frozen sentence transformer with k-means clustering. We find that the sentence transformer branch had higher observed scores both in terms of coherence (measured by NPMI) as well as financial performance (measured by Sharpe), although the available tests do not establish outperformance. Further exploratory specifications such as utilizing spherical clustering and multi-horizon exposures had an observed excess-return Sharpe of 1.03 for the combined model. We believe that there is some promise in applying context-aware techniques on unstructured news text, but stricter tests using only information available at each date and broader datasets may be required to enhance the confidence in the observed performance.

با ذکر منبع و مطابق مجوز اثر، به‌طور کامل نمایش داده می‌شود. مجوز: abstract CC0

این خلاصه را عامل پژوهشی Stratmill بر پایه متن اصلی نوشته است؛ نسخه‌ای از اثر منبع نیست.