Saltar al contenido
Todos los documentos de la biblioteca

Temas de noticias con contexto para factores de valoración de activos

Artículo arXiv papers · Autor: Kevin Foley et al.

Resumen

Este estudio evalúa si el contexto a nivel de frase mejora los modelos de temas de noticias usados para construir factores sistemáticos de valoración de activos. Compara la asignación latente de Dirichlet con un transformador de frases congelado seguido de una agrupación k-means, usando la misma colección de 394,661 artículos y el mismo proceso posterior de construcción de carteras. Los enfoques también difieren en la cantidad de texto de los artículos que utilizan y en cómo clasifican los términos de los temas.

El enfoque del transformador obtuvo una mayor coherencia temática, medida por NPMI, y puntuaciones de Sharpe de cartera más altas, pero las pruebas disponibles no demuestran que supere a LDA. Las versiones exploratorias con agrupación esférica y exposiciones en varios horizontes produjeron un modelo combinado con un Sharpe de exceso de rentabilidad de 1.03. Los resultados sugieren que las representaciones sensibles al contexto pueden ayudar a extraer señales de utilidad financiera de las noticias. La confianza sigue siendo limitada: el estudio pide pruebas más estrictas que restrinjan las entradas a la información disponible en cada fecha y una evaluación con conjuntos de datos más amplios.

Ideas clave

  • El estudio compara temas de LDA con temas obtenidos a partir de incrustaciones de un transformador de frases agrupadas mediante k-means.
  • En el análisis comunicado, tanto la coherencia temática como las puntuaciones de Sharpe de cartera fueron superiores con el enfoque del transformador.
  • La comparación utiliza la misma colección de artículos y el mismo proceso posterior de construcción de carteras, aunque difieren el texto de entrada y la clasificación de términos.
  • La agrupación esférica exploratoria y las exposiciones en varios horizontes dieron un Sharpe de exceso de rentabilidad de 1.03 para el modelo combinado.
  • Las pruebas no son concluyentes; hacen falta análisis con información disponible en cada fecha y conjuntos de datos más amplios.

Etiquetas

Texto completo
# From Word Counts to Context: Topic Models for Asset Pricing


# From Word Counts to Context: Topic Models for Asset Pricing









News may reveal systematic risk, but whether its context enhances the construction of systematic risk factors is still unclear. We seek to test whether utilizing a sentence transformer represents an improvement over techniques such as Latent Dirichlet Allocation (LDA) in the coherence of topic term lists generated from unstructured text data. To test this, the same collection of unstructured text data comprising of 394,661 articles and the same downstream financial portfolio construction pipeline were applied with the text layer differing, including the length of article text each model used and how topic terms were ranked: we benchmark LDA against a frozen sentence transformer with k-means clustering. We find that the sentence transformer branch had higher observed scores both in terms of coherence (measured by NPMI) as well as financial performance (measured by Sharpe), although the available tests do not establish outperformance. Further exploratory specifications such as utilizing spherical clustering and multi-horizon exposures had an observed excess-return Sharpe of 1.03 for the combined model. We believe that there is some promise in applying context-aware techniques on unstructured news text, but stricter tests using only information available at each date and broader datasets may be required to enhance the confidence in the observed performance.

Se muestra íntegramente con atribución según la licencia de la fuente. Licencia: abstract CC0

Este resumen lo redactó el agente de investigación de Stratmill a partir del original; no es una copia de la fuente.