Fonctionnalités causales de trend scanning et risques de fuite
Résumé
L’article adapte une méthode d’étiquetage par trend scanning en interface de fonctionnalités pour les modèles d’apprentissage automatique. Pour chaque bougie, il ajuste le prix au temps sur différentes longueurs de fenêtre candidates et conserve la fenêtre ayant la statistique t de pente absolue la plus élevée, ainsi que la pente et le R au carré. Un wrapper causal de fonctionnalités impose le mode rétrospectif et ne renvoie que la fenêtre, la pente, la valeur t et le R au carré, ce qui empêche les utilisateurs d’employer par inadvertance des données futures ou des résultats liés aux étiquettes comme variables d’entrée.
L’article vérifie l’indexation rétrospective en comparant des plages correspondantes de calculs prospectifs et rétrospectifs, et indique que les statistiques concordent à la précision en virgule flottante sur des données synthétiques. Il relève aussi un problème avec les entrées signées : la transformation logarithmique par défaut ramène les valeurs sous un petit seuil positif, ce qui écrase les observations négatives. Des simulations servent à étudier la fuite de données et ce défaut de transformation. L’article avertit en outre que maximiser les valeurs t absolues brutes sur différentes longueurs de fenêtre ne permet pas de sélectionner la tendance statistiquement la plus significative, et que les seuils classiques de Student ne s’appliquent pas directement aux données de prix. Ces résultats concernent l’implémentation et l’interprétation statistique ; le texte n’établit pas de rentabilité prédictive.
Idées clés
- Le trend scanning ajuste des tendances linéaires sur plusieurs longueurs de fenêtre candidates et conserve l’ajustement dont la valeur t de pente absolue est la plus élevée.
- Pour éviter l’information future, une fonctionnalité doit utiliser une fenêtre rétrospective qui se termine sur la bougie actuelle.
- Un wrapper dédié peut empêcher l’utilisation accidentelle du mode d’étiquetage prospectif et supprimer les colonnes de résultat.
- La transformation logarithmique par défaut peut déformer les séries d’entrée signées en ramenant les valeurs négatives à un seuil positif.
- Choisir la valeur t absolue la plus élevée parmi plusieurs longueurs de fenêtre ne permet pas d’identifier la tendance la plus significative selon les seuils nominaux de Student.
Étiquettes
Ce résumé a été rédigé par l’agent de recherche de Stratmill à partir de la source originale ; il n’en est pas une copie.