Zum Inhalt springen
Alle Bibliotheksdokumente

Kontextbezogene Nachrichtenthemen für Asset-Pricing-Faktoren

Artikel arXiv papers · Autor: Kevin Foley et al.

Zusammenfassung

Diese Studie prüft, ob Kontext auf Satzebene Nachrichtenthemenmodelle verbessert, die zum Aufbau systematischer Asset-Pricing-Faktoren verwendet werden. Sie vergleicht Latent Dirichlet Allocation mit einem eingefrorenen Satz-Transformer und anschließendem k-Means-Clustering. Dabei kommen dieselbe Sammlung von 394,661 Artikeln und derselbe nachgelagerte Prozess der Portfolio-Konstruktion zum Einsatz. Die Ansätze unterscheiden sich außerdem darin, wie viel Artikeltext sie verwenden und wie sie Themenbegriffe ordnen.

Der Transformer-Ansatz erzielte eine höhere Themenkohärenz, gemessen anhand von NPMI, sowie höhere Portfolio-Sharpe-Werte; die verfügbaren Tests belegen jedoch nicht, dass er LDA übertrifft. Explorative Varianten mit sphärischem Clustering und Exposures über mehrere Horizonte ergaben ein kombiniertes Modell mit einer Sharpe-Ratio der Überschussrendite von 1.03. Die Ergebnisse deuten darauf hin, dass kontextbewusste Repräsentationen dabei helfen könnten, finanziell nützliche Signale aus Nachrichten zu gewinnen. Die Aussagekraft bleibt begrenzt: Die Studie fordert strengere Tests, die Eingaben auf die zu jedem Datum verfügbaren Informationen beschränken, sowie Bewertungen anhand breiterer Datensätze.

Kernaussagen

  • Die Studie vergleicht LDA-Themen mit Themen aus Satz-Transformer-Einbettungen, die per k-Means gruppiert wurden.
  • In der berichteten Analyse waren sowohl die Themenkohärenz als auch die Portfolio-Sharpe-Werte beim Transformer-Ansatz höher.
  • Der Vergleich nutzt dieselbe Artikelsammlung und dieselbe nachgelagerte Portfolio-Konstruktion, auch wenn Texteingabe und Rangfolge der Begriffe unterschiedlich sind.
  • Exploratives sphärisches Clustering und Engagements über mehrere Horizonte ergaben beim kombinierten Modell eine Sharpe-Ratio der Überschussrendite von 1.03.
  • Die Belege sind nicht schlüssig; erforderlich sind Tests mit stichtagsbezogenen Informationen und breitere Datensätze.

Schlagwörter

Volltext
# From Word Counts to Context: Topic Models for Asset Pricing


# From Word Counts to Context: Topic Models for Asset Pricing









News may reveal systematic risk, but whether its context enhances the construction of systematic risk factors is still unclear. We seek to test whether utilizing a sentence transformer represents an improvement over techniques such as Latent Dirichlet Allocation (LDA) in the coherence of topic term lists generated from unstructured text data. To test this, the same collection of unstructured text data comprising of 394,661 articles and the same downstream financial portfolio construction pipeline were applied with the text layer differing, including the length of article text each model used and how topic terms were ranked: we benchmark LDA against a frozen sentence transformer with k-means clustering. We find that the sentence transformer branch had higher observed scores both in terms of coherence (measured by NPMI) as well as financial performance (measured by Sharpe), although the available tests do not establish outperformance. Further exploratory specifications such as utilizing spherical clustering and multi-horizon exposures had an observed excess-return Sharpe of 1.03 for the combined model. We believe that there is some promise in applying context-aware techniques on unstructured news text, but stricter tests using only information available at each date and broader datasets may be required to enhance the confidence in the observed performance.

Vollständig mit Quellenangabe unter der Lizenz der Quelle angezeigt. Lizenz: abstract CC0

Diese Zusammenfassung wurde vom Research-Agenten von Stratmill anhand des Originals verfasst; sie ist keine Kopie der Quelle.