Контекст новостей и факторы ценообразования активов
Сводка
В исследовании проверяется, улучшает ли контекст на уровне предложений тематические модели новостей, используемые для построения систематических факторов ценообразования активов. Сравниваются латентное размещение Дирихле и замороженный трансформер предложений с последующей кластеризацией k-means; для обоих подходов используются одна и та же подборка из 394,661 статей и последующая процедура построения портфеля. Подходы также различаются объёмом используемого текста статей и способом ранжирования тематических терминов.
У трансформерного подхода были выше когерентность тем, измеренная с помощью NPMI, и коэффициенты Шарпа портфелей, но имеющиеся тесты не доказывают его превосходство над LDA. В исследовательских вариантах с использованием сферической кластеризации и экспозиций на нескольких горизонтах объединённая модель показала коэффициент Шарпа избыточной доходности 1.03. Результаты указывают, что представления с учётом контекста могут помогать извлекать из новостей полезные для финансового анализа сигналы. Уверенность в выводах ограничена: в исследовании предлагается провести более строгие тесты, использовать только информацию, доступную на соответствующую дату, и оценить подход на более широких наборах данных.
Ключевые идеи
- В исследовании сравниваются темы LDA и темы, полученные из эмбеддингов трансформера предложений с кластеризацией k-means.
- В описанном анализе трансформерный подход дал более высокие показатели когерентности тем и коэффициента Шарпа портфеля.
- В обоих подходах используется одна подборка статей и одна последующая процедура построения портфеля, хотя входной текст и ранжирование терминов различаются.
- Исследовательские варианты со сферической кластеризацией и экспозициями на нескольких горизонтах дали объединённой модели коэффициент Шарпа избыточной доходности 1.03.
- Доказательства не окончательны; необходимы тесты с учётом информации на конкретный момент времени и более широкие наборы данных.
Теги
Полный текст
# From Word Counts to Context: Topic Models for Asset Pricing # From Word Counts to Context: Topic Models for Asset Pricing News may reveal systematic risk, but whether its context enhances the construction of systematic risk factors is still unclear. We seek to test whether utilizing a sentence transformer represents an improvement over techniques such as Latent Dirichlet Allocation (LDA) in the coherence of topic term lists generated from unstructured text data. To test this, the same collection of unstructured text data comprising of 394,661 articles and the same downstream financial portfolio construction pipeline were applied with the text layer differing, including the length of article text each model used and how topic terms were ranked: we benchmark LDA against a frozen sentence transformer with k-means clustering. We find that the sentence transformer branch had higher observed scores both in terms of coherence (measured by NPMI) as well as financial performance (measured by Sharpe), although the available tests do not establish outperformance. Further exploratory specifications such as utilizing spherical clustering and multi-horizon exposures had an observed excess-return Sharpe of 1.03 for the combined model. We believe that there is some promise in applying context-aware techniques on unstructured news text, but stricter tests using only information available at each date and broader datasets may be required to enhance the confidence in the observed performance.
Полный текст с указанием источника опубликован на условиях его лицензии. Лицензия: abstract CC0
Это краткое изложение подготовлено исследовательским агентом Stratmill по оригиналу и не является его копией.