Prédire les rendements du S&P 100 à partir des recherches
Résumé
L’article examine si l’activité de recherche sur Google peut aider à prévoir quelles actions du S&P 100 feront mieux que la médiane de l’indice le lendemain. Il combine des variables financières retardées et les volumes de requêtes de recherche, puis entraîne des arbres de décision à gradient boosting pour classer ces résultats. L’étude couvre la période de 2005 à 2017 et rapporte des aires ROC moyennes de ROC, comprises entre 54.2% et 56.7%, ce qui indique un pouvoir prédictif supérieur au hasard. Dans l’exercice de portefeuille présenté, les modèles combinant plusieurs sources de données obtiennent les meilleurs résultats.
Les auteurs constituent aussi des portefeuilles quotidiens de dix actions selon une approche simple d’arbitrage statistique et rapportent une performance annuelle supérieure à 57% avant coûts de transaction. Ces chiffres proviennent d’un backtest et ne prouvent pas que les rendements de trading nets aient été réalisés. Les coûts de transaction sont exclus, et le résumé ne fournit aucun détail sur la robustesse, la construction du portefeuille ou les contraintes de mise en œuvre. Les résultats suggèrent que les comportements de recherche peuvent apporter des informations utiles à la prévision des cours à court terme, sans lever l’incertitude sur la rentabilité pratique ni sur les implications pour l’efficience des marchés.
Idées clés
- Les volumes de requêtes sont associés aux données financières historiques pour classer les rendements relatifs des actions le lendemain.
- Des arbres de décision à gradient boosté produisent des prévisions pour les actions du S&P 100.
- La performance de classification rapportée dépasse celle du hasard pendant la période étudiée.
- Un exercice sur un portefeuille de dix actions rapporte des rendements élevés avant coûts, mais exclut les coûts de transaction.
- Les résultats soulèvent des questions sur l’efficience des marchés sans établir l’existence de bénéfices nets réalisables.
Étiquettes
Texte intégral
# 2205.15853 # Predicting Day-Ahead Stock Returns using Search Engine Query Volumes: An Application of Gradient Boosted Decision Trees to the S&P 100 The internet has changed the way we live, work and take decisions. As it is the major modern resource for research, detailed data on internet usage exhibits vast amounts of behavioral information. This paper aims to answer the question whether this information can be facilitated to predict future returns of stocks on financial capital markets. In an empirical analysis it implements gradient boosted decision trees to learn relationships between abnormal returns of stocks within the S&P 100 index and lagged predictors derived from historical financial data, as well as search term query volumes on the internet search engine Google. Models predict the occurrence of day-ahead stock returns in excess of the index median. On a time frame from 2005 to 2017, all disparate datasets exhibit valuable information. Evaluated models have average areas under the receiver operating characteristic between 54.2% and 56.7%, clearly indicating a classification better than random guessing. Implementing a simple statistical arbitrage strategy, models are used to create daily trading portfolios of ten stocks and result in annual performances of more than 57% before transaction costs. With ensembles of different data sets topping up the performance ranking, the results further question the weak form and semi-strong form efficiency of modern financial capital markets. Even though transaction costs are not included, the approach adds to the existing literature. It gives guidance on how to use and transform data on internet usage behavior for financial and economic modeling and forecasting.
Reproduit dans son intégralité avec attribution, conformément à la licence de la source. Licence: abstract CC0
Ce résumé a été rédigé par l’agent de recherche de Stratmill à partir de la source originale ; il n’en est pas une copie.