Chuyển đến nội dung
Tất cả tài liệu trong thư viện

Chủ đề tin tức có xét ngữ cảnh cho các nhân tố định giá tài sản

Bài viết arXiv papers · Tác giả: Kevin Foley et al.

Tóm tắt

Nghiên cứu kiểm tra liệu ngữ cảnh ở cấp câu có cải thiện mô hình chủ đề tin tức dùng để xây dựng các nhân tố định giá tài sản có hệ thống hay không. Nghiên cứu so sánh Latent Dirichlet Allocation với bộ chuyển đổi câu cố định, sau đó phân cụm bằng k-means, sử dụng cùng tập hợp 394,661 bài viết và quy trình xây dựng danh mục ở bước sau. Các phương pháp cũng khác nhau về lượng văn bản bài viết được sử dụng và cách xếp hạng các thuật ngữ chủ đề.

Phương pháp dùng bộ chuyển đổi ghi nhận độ mạch lạc chủ đề cao hơn, đo bằng NPMI, và điểm Sharpe danh mục cao hơn, nhưng các kiểm định hiện có không xác lập rằng phương pháp này vượt trội hơn LDA. Các phiên bản thăm dò dùng phân cụm hình cầu và mức độ phơi nhiễm qua nhiều chân trời tạo ra mô hình kết hợp có Sharpe của lợi nhuận vượt trội là 1.03. Phát hiện gợi ý rằng các biểu diễn có nhận biết ngữ cảnh có thể giúp trích xuất tín hiệu hữu ích về tài chính từ tin tức. Mức độ tin cậy vẫn hạn chế: nghiên cứu đề nghị kiểm định nghiêm ngặt hơn, chỉ dùng đầu vào có sẵn tại từng thời điểm, và đánh giá trên tập dữ liệu rộng hơn.

Ý chính

  • Nghiên cứu so sánh các chủ đề LDA với chủ đề từ embedding bộ chuyển đổi câu được phân cụm bằng k-means.
  • Trong phân tích được báo cáo, phương pháp bộ chuyển đổi có độ mạch lạc chủ đề và điểm Sharpe danh mục cao hơn.
  • Phép so sánh dùng cùng tập hợp bài viết và quy trình xây dựng danh mục ở bước sau, dù đầu vào văn bản và cách xếp hạng thuật ngữ khác nhau.
  • Phân cụm hình cầu thăm dò và mức độ phơi nhiễm đa chân trời tạo ra Sharpe của lợi nhuận vượt trội là 1.03 cho mô hình kết hợp.
  • Bằng chứng chưa mang tính kết luận; cần kiểm định theo thời điểm và tập dữ liệu rộng hơn.

Thẻ

Toàn văn
# From Word Counts to Context: Topic Models for Asset Pricing


# From Word Counts to Context: Topic Models for Asset Pricing









News may reveal systematic risk, but whether its context enhances the construction of systematic risk factors is still unclear. We seek to test whether utilizing a sentence transformer represents an improvement over techniques such as Latent Dirichlet Allocation (LDA) in the coherence of topic term lists generated from unstructured text data. To test this, the same collection of unstructured text data comprising of 394,661 articles and the same downstream financial portfolio construction pipeline were applied with the text layer differing, including the length of article text each model used and how topic terms were ranked: we benchmark LDA against a frozen sentence transformer with k-means clustering. We find that the sentence transformer branch had higher observed scores both in terms of coherence (measured by NPMI) as well as financial performance (measured by Sharpe), although the available tests do not establish outperformance. Further exploratory specifications such as utilizing spherical clustering and multi-horizon exposures had an observed excess-return Sharpe of 1.03 for the combined model. We believe that there is some promise in applying context-aware techniques on unstructured news text, but stricter tests using only information available at each date and broader datasets may be required to enhance the confidence in the observed performance.

Hiển thị toàn văn kèm ghi nguồn theo giấy phép của tài liệu gốc. Giấy phép: abstract CC0

Bản tóm tắt này do tác nhân nghiên cứu của Stratmill biên soạn từ tài liệu gốc; đây không phải bản sao của tài liệu.