Pular para o conteúdo
Todos os documentos da biblioteca

Tópicos de notícias sensíveis ao contexto para fatores de precificação de ativos

Artigo arXiv papers · Autor: Kevin Foley et al.

Resumo

Este estudo testa se o contexto em nível de frase melhora modelos de tópicos de notícias usados para construir fatores sistemáticos de precificação de ativos. Compara Latent Dirichlet Allocation com um modelo transformer de frases com parâmetros congelados, seguido de agrupamento k-means, usando a mesma coleção de 394,661 artigos e o mesmo processo subsequente de construção de carteiras. As abordagens também diferem na quantidade de texto dos artigos que usam e na forma como classificam os termos dos tópicos.

A abordagem com transformador registrou maior coerência dos tópicos, medida por NPMI, e maiores índices de Sharpe das carteiras, mas os testes disponíveis não demonstram que ela supera LDA. Versões exploratórias com agrupamento esférico e exposições em vários horizontes produziram um modelo combinado com índice de Sharpe de retorno excedente de 1.03. Os resultados sugerem que representações sensíveis ao contexto podem ajudar a extrair sinais financeiramente úteis das notícias. A confiança permanece limitada: o estudo pede testes mais rigorosos, que restrinjam as entradas às informações disponíveis em cada data, e avaliação em conjuntos de dados mais amplos.

Ideias principais

  • O estudo compara tópicos de LDA com tópicos de embeddings de transformadores de frases agrupados por k-means.
  • Na análise relatada, tanto a coerência dos tópicos quanto os índices de Sharpe das carteiras foram maiores para a abordagem com transformador.
  • A comparação usa a mesma coleção de artigos e o mesmo processo de construção de carteiras, embora variem o texto de entrada e a classificação dos termos.
  • O agrupamento esférico exploratório e as exposições em vários horizontes geraram índice de Sharpe de retorno excedente de 1.03 para o modelo combinado.
  • As evidências não são conclusivas; são necessários testes com informações disponíveis em cada data e conjuntos de dados mais amplos.

Tags

Texto completo
# From Word Counts to Context: Topic Models for Asset Pricing


# From Word Counts to Context: Topic Models for Asset Pricing









News may reveal systematic risk, but whether its context enhances the construction of systematic risk factors is still unclear. We seek to test whether utilizing a sentence transformer represents an improvement over techniques such as Latent Dirichlet Allocation (LDA) in the coherence of topic term lists generated from unstructured text data. To test this, the same collection of unstructured text data comprising of 394,661 articles and the same downstream financial portfolio construction pipeline were applied with the text layer differing, including the length of article text each model used and how topic terms were ranked: we benchmark LDA against a frozen sentence transformer with k-means clustering. We find that the sentence transformer branch had higher observed scores both in terms of coherence (measured by NPMI) as well as financial performance (measured by Sharpe), although the available tests do not establish outperformance. Further exploratory specifications such as utilizing spherical clustering and multi-horizon exposures had an observed excess-return Sharpe of 1.03 for the combined model. We believe that there is some promise in applying context-aware techniques on unstructured news text, but stricter tests using only information available at each date and broader datasets may be required to enhance the confidence in the observed performance.

Exibido na íntegra, com atribuição conforme a licença da fonte. Licença: abstract CC0

Este resumo foi escrito pelo agente de pesquisa da Stratmill com base no original; não é uma cópia da fonte.