موضوعات خبری آگاه از بافت برای عوامل قیمتگذاری دارایی
خلاصه
این مطالعه میآزماید که آیا بافت جملهای مدلهای موضوعی اخبار را که برای ساخت عوامل نظاممند قیمتگذاری دارایی به کار میروند بهبود میدهد یا نه. تخصیص پنهان دیریکله را با یک تبدیلگر جملهای که وزنهای آن ثابت نگه داشته شدهاند و سپس خوشهبندی k-means مقایسه میکند؛ هر دو از مجموعه یکسانی شامل 394,661 مقاله و فرایند یکسان ساخت سبد در مرحله بعد استفاده میکنند. این رویکردها از نظر میزان متن مقاله مورد استفاده و روش رتبهبندی واژههای موضوعی نیز تفاوت دارند.
رویکرد تبدیلگر همخوانی موضوعی بالاتری، بر اساس NPMI، و امتیازهای شارپ سبد بالاتری ثبت کرد؛ اما آزمونهای موجود نشان نمیدهند که از LDA بهتر است. نسخههای اکتشافی با خوشهبندی کروی و مواجهه در افقهای چندگانه، مدلی ترکیبی با شارپ بازده مازاد 1.03 ایجاد کردند. یافتهها نشان میدهند بازنماییهای آگاه از بافت ممکن است به استخراج سیگنالهای مالی سودمند از اخبار کمک کنند. میزان اطمینان همچنان محدود است: مطالعه خواستار آزمونهای سختگیرانهتری است که ورودیها را به اطلاعات در دسترس در هر تاریخ محدود کنند و ارزیابی را روی مجموعهدادههای گستردهتر انجام دهند.
ایدههای کلیدی
- مطالعه موضوعات LDA را با موضوعات حاصل از تعبیههای تبدیلگر جملهای که با k-means خوشهبندی شدهاند مقایسه میکند.
- در تحلیل گزارششده، هم همخوانی موضوعی و هم امتیازهای شارپ سبد برای رویکرد تبدیلگر بالاتر بود.
- مقایسه از مجموعه مقالات و خط لوله ساخت سبد یکسانی استفاده میکند، هرچند ورودی متنی و رتبهبندی واژهها متفاوت است.
- خوشهبندی کروی اکتشافی و مواجهههای چندافقی برای مدل ترکیبی شارپ بازده مازاد 1.03 به همراه داشتند.
- شواهد قطعی نیستند و به آزمونهای نقطهدرزمان و مجموعهدادههای گستردهتر نیاز است.
برچسبها
متن کامل
# From Word Counts to Context: Topic Models for Asset Pricing # From Word Counts to Context: Topic Models for Asset Pricing News may reveal systematic risk, but whether its context enhances the construction of systematic risk factors is still unclear. We seek to test whether utilizing a sentence transformer represents an improvement over techniques such as Latent Dirichlet Allocation (LDA) in the coherence of topic term lists generated from unstructured text data. To test this, the same collection of unstructured text data comprising of 394,661 articles and the same downstream financial portfolio construction pipeline were applied with the text layer differing, including the length of article text each model used and how topic terms were ranked: we benchmark LDA against a frozen sentence transformer with k-means clustering. We find that the sentence transformer branch had higher observed scores both in terms of coherence (measured by NPMI) as well as financial performance (measured by Sharpe), although the available tests do not establish outperformance. Further exploratory specifications such as utilizing spherical clustering and multi-horizon exposures had an observed excess-return Sharpe of 1.03 for the combined model. We believe that there is some promise in applying context-aware techniques on unstructured news text, but stricter tests using only information available at each date and broader datasets may be required to enhance the confidence in the observed performance.
با ذکر منبع و مطابق مجوز اثر، بهطور کامل نمایش داده میشود. مجوز: abstract CC0
این خلاصه را عامل پژوهشی Stratmill بر پایه متن اصلی نوشته است؛ نسخهای از اثر منبع نیست.