Прогноз доходности акций S&P 100 по поисковым запросам
Сводка
В статье проверяется, помогают ли поисковые запросы Google предсказать, какие акции из индекса S&P 100 на следующий день покажут результат выше медианы индекса. Для классификации таких случаев используются запаздывающие финансовые переменные и объёмы поисковых запросов; модель обучается на градиентном бустинге деревьев решений. Исследование охватывает период с 2005 по 2017; средняя площадь под ROC-кривой составляет от 54.2% до 56.7% (ROC), что указывает на прогностическую способность выше случайного уровня. В описанном портфельном эксперименте лучшие результаты показали модели, объединяющие разные источники данных.
Авторы также формируют ежедневные портфели из десяти акций с помощью простого подхода статистического арбитража и сообщают о годовой доходности выше 57% до учёта транзакционных издержек. Эти показатели получены в бэктесте и не доказывают фактическую чистую доходность торговли. Транзакционные издержки не учтены, а в кратком описании нет сведений об устойчивости результатов, формировании портфеля или ограничениях реализации. Результаты показывают, что поисковое поведение может дать дополнительную информацию для краткосрочного прогноза акций, однако практическая прибыльность и последствия для эффективности рынка остаются неопределёнными.
Ключевые идеи
- Объёмы поисковых запросов объединяются с историческими финансовыми данными для классификации относительной доходности акций на следующий день.
- Градиентные деревья решений строят прогнозы для акций S&P 100.
- За исследуемый период заявленная точность классификации была выше случайного угадывания.
- В примере с портфелем из десяти акций сообщается о высокой доходности до издержек, однако транзакционные издержки не учтены.
- Результаты поднимают вопросы об эффективности рынка, но не доказывают возможность получить чистую реализуемую прибыль.
Теги
Полный текст
# 2205.15853 # Predicting Day-Ahead Stock Returns using Search Engine Query Volumes: An Application of Gradient Boosted Decision Trees to the S&P 100 The internet has changed the way we live, work and take decisions. As it is the major modern resource for research, detailed data on internet usage exhibits vast amounts of behavioral information. This paper aims to answer the question whether this information can be facilitated to predict future returns of stocks on financial capital markets. In an empirical analysis it implements gradient boosted decision trees to learn relationships between abnormal returns of stocks within the S&P 100 index and lagged predictors derived from historical financial data, as well as search term query volumes on the internet search engine Google. Models predict the occurrence of day-ahead stock returns in excess of the index median. On a time frame from 2005 to 2017, all disparate datasets exhibit valuable information. Evaluated models have average areas under the receiver operating characteristic between 54.2% and 56.7%, clearly indicating a classification better than random guessing. Implementing a simple statistical arbitrage strategy, models are used to create daily trading portfolios of ten stocks and result in annual performances of more than 57% before transaction costs. With ensembles of different data sets topping up the performance ranking, the results further question the weak form and semi-strong form efficiency of modern financial capital markets. Even though transaction costs are not included, the approach adds to the existing literature. It gives guidance on how to use and transform data on internet usage behavior for financial and economic modeling and forecasting.
Полный текст с указанием источника опубликован на условиях его лицензии. Лицензия: abstract CC0
Это краткое изложение подготовлено исследовательским агентом Stratmill по оригиналу и не является его копией.