Thèmes d’actualité contextualisés pour les facteurs d’évaluation des actifs
Résumé
Cette étude teste si le contexte à l’échelle de la phrase améliore les modèles de thèmes d’actualité utilisés pour construire des facteurs systématiques d’évaluation des actifs. Elle compare l’allocation de Dirichlet latente à un transformeur de phrases figé suivi d’un regroupement k-means, en utilisant le même ensemble de 394,661 articles et le même processus de construction de portefeuille en aval. Les approches diffèrent également par la quantité de texte des articles utilisée et leur méthode de classement des termes thématiques.
L’approche par transformeur a obtenu une cohérence thématique supérieure, mesurée par NPMI, ainsi que des ratios de Sharpe de portefeuille plus élevés, mais les tests disponibles n’établissent pas qu’elle surpasse LDA. Des versions exploratoires utilisant un regroupement sphérique et des expositions à plusieurs horizons ont produit un modèle combiné avec un ratio de Sharpe du rendement excédentaire de 1.03. Les résultats suggèrent que les représentations tenant compte du contexte peuvent aider à extraire des nouvelles des signaux utiles sur le plan financier. Le niveau de confiance reste limité : l’étude appelle à des tests plus stricts qui limitent les entrées aux informations disponibles à chaque date et à des évaluations sur des jeux de données plus vastes.
Idées clés
- L’étude compare les thèmes de LDA aux thèmes issus d’intégrations de transformeur de phrases regroupées par k-means.
- Dans l’analyse présentée, l’approche par transformeur obtient une cohérence thématique et des ratios de Sharpe de portefeuille supérieurs.
- La comparaison utilise le même ensemble d’articles et le même processus de construction de portefeuille en aval, mais le texte fourni et le classement des termes diffèrent.
- Le regroupement sphérique exploratoire et les expositions à plusieurs horizons ont produit un ratio de Sharpe du rendement excédentaire de 1.03 pour le modèle combiné.
- Les résultats ne sont pas concluants ; des tests à information disponible à la date considérée et des jeux de données plus vastes sont nécessaires.
Étiquettes
Texte intégral
# From Word Counts to Context: Topic Models for Asset Pricing # From Word Counts to Context: Topic Models for Asset Pricing News may reveal systematic risk, but whether its context enhances the construction of systematic risk factors is still unclear. We seek to test whether utilizing a sentence transformer represents an improvement over techniques such as Latent Dirichlet Allocation (LDA) in the coherence of topic term lists generated from unstructured text data. To test this, the same collection of unstructured text data comprising of 394,661 articles and the same downstream financial portfolio construction pipeline were applied with the text layer differing, including the length of article text each model used and how topic terms were ranked: we benchmark LDA against a frozen sentence transformer with k-means clustering. We find that the sentence transformer branch had higher observed scores both in terms of coherence (measured by NPMI) as well as financial performance (measured by Sharpe), although the available tests do not establish outperformance. Further exploratory specifications such as utilizing spherical clustering and multi-horizon exposures had an observed excess-return Sharpe of 1.03 for the combined model. We believe that there is some promise in applying context-aware techniques on unstructured news text, but stricter tests using only information available at each date and broader datasets may be required to enhance the confidence in the observed performance.
Reproduit dans son intégralité avec attribution, conformément à la licence de la source. Licence: abstract CC0
Ce résumé a été rédigé par l’agent de recherche de Stratmill à partir de la source originale ; il n’en est pas une copie.