Quatre chiffres racontent une histoire dérangeante : un Sharpe walk-forward de 1.4, 312 trades historiques, 46 trades en paper trading et un écart de 18 points de base entre les prix d’exécution en paper trading et ceux du backtest. Le Sharpe fait les gros titres. Les 18 points de base peuvent expliquer pourquoi la stratégie semble différente avant qu’on ait assez d’historique en paper trading pour évaluer ses performances.
Le test walk-forward cherche à déterminer si un processus de recherche aurait pu sélectionner une stratégie à partir de données passées, puis l’évaluer sur des données ultérieures. Le paper trading cherche à savoir si un système en fonctionnement, avec ses données, ses horloges, sa logique d’ordres et ses exécutions actuelles, se comporte comme le processus testé. Ces questions sont liées, mais la première ne répond pas automatiquement à la seconde.
Qu’établit réellement la validation walk-forward ?
Supposons que vous entraîniez ou sélectionniez une stratégie sur six mois de données, puis l’évaluiez sur le mois suivant. Décalez cette fenêtre et recommencez. Si chaque mois de test est exclu du processus de sélection correspondant, l’exercice vous apporte des éléments sur les performances dans une série de conditions historiques.
Cela ne permet pas d’établir que le paper trading reproduira les mêmes décisions ou exécutions. Le test historique peut s’appuyer sur des bougies clôturées, une grille de frais fixe et un modèle simplifié d’ordres au marché. Le processus de paper trading, lui, reçoit les données au fil de leur arrivée et soumet des ordres simulés par un autre chemin. L’un peut être solide tandis que l’autre présente un décalage.
C’est pourquoi 46 trades en paper trading contre 312 dans l’échantillon walk-forward ne suffisent pas, à eux seuls, à trancher. Vérifiez la période de comparaison, la fréquence des signaux, les positions ouvertes aux limites de la période et si les deux comptages définissent un trade de la même manière. Une session de paper trading de six semaines ne peut pas égaler en nombre de trades une année de tests glissants.
Pourquoi l’écart d’exécution est-il si révélateur ?
Un écart moyen de 18 points de base mérite d’être analysé avant d’interpréter une courbe de capital en paper trading. Est-il calculé entre le prix d’exécution supposé du backtest et celui du simulateur de paper trading, ou entre le prix médian au moment de la décision et l’exécution simulée ? Ces mesures ne correspondent pas à la même chose. Consignez séparément le prix de décision, le prix à l’arrivée de l’ordre, l’exécution simulée, les frais et tout financement éventuel.
| Écart observé | Premier point à vérifier | Pourquoi c’est important |
|---|---|---|
| Moins de trades en paper trading | Horodatages des signaux et règles d’éligibilité | Une donnée absente ou retardée peut empêcher des décisions |
| Mêmes trades, exécutions moins bonnes | Type d’ordre, spread, impact et niveau de frais | Le backtest suppose peut-être un mode d’exécution moins coûteux |
| Tailles de position différentes | Liquidités, multiplicateur de contrat et arrondis | De petits écarts d’unités s’accumulent d’un ordre à l’autre |
| Dérive après un redémarrage | Position et ordres en attente après la reprise | Le processus de paper trading peut reprendre dans un état différent |
Par exemple, un backtest qui achète à l’ouverture de la bougie suivante peut sembler proche d’un ordre au marché en paper trading sur un instrument liquide. Mais si l’ordre en paper trading arrive après un mouvement brusque, l’écart englobe aussi le timing et le mouvement du marché, en plus du coût d’exécution. Qualifier les 18 points de base de « slippage » masque la cause.
Comment comparer le paper trading à un test walk-forward ?
Commencez par les décisions, puis passez aux ordres et enfin aux exécutions. Pour chaque décision prise en paper trading, rejouez la même version de la stratégie sur le même historique d’entrées et comparez ce qu’elle savait à cet instant. Un journal de parité utile comprend :
- La version de la stratégie et ses paramètres, y compris la fenêtre de sélection qui les a produits.
- Les valeurs d’entrée avec leur heure d’événement et leur heure de disponibilité.
- Le signal, la position cible, la position actuelle et l’ordre proposé.
- Les contraintes d’ordre, les frais, le financement et les détails de l’exécution simulée.
- L’état des liquidités et des positions avant et après l’exécution.
Si les signaux diffèrent, examinez le timing des données et les versions du code. Si les signaux concordent mais que les ordres diffèrent, vérifiez le dimensionnement, les règles de la plateforme et l’état du portefeuille. Si les ordres concordent mais que les exécutions diffèrent, examinez les hypothèses d’exécution. Gardez ces étapes distinctes ; sinon, un seul indicateur de performance vous enverra chercher au mauvais endroit.
À quel moment la dérive indique-t-elle une stratégie défaillante ?
Une fois le pipeline aligné, comparez les résultats sur une période commune pertinente et examinez le comportement prévu de la stratégie. Quelques trades en paper trading peuvent rapidement révéler un horodatage erroné ou un problème dans le chemin des ordres. Ils ne permettent pas de déterminer de façon fiable si le rendement moyen d’une stratégie a changé. Il faut suffisamment d’observations, et le nombre nécessaire dépend du niveau de bruit et de regroupement de ses rendements.
Les conditions de marché peuvent aussi évoluer. Un spread qui s’élargit ou un financement durablement défavorable peut pénaliser la stratégie, même si chaque décision correspond. Il s’agit d’un changement réel des conditions de trading, et non d’un défaut de validation. Consignez les coûts et les expositions en parallèle des rendements afin de pouvoir faire la distinction.
La validation walk-forward apporte des éléments sur un processus de sélection appliqué à des périodes historiques. Le paper trading renseigne sur le système en fonctionnement dans les conditions observées. Lorsque leurs résultats divergent, trouvez d’abord le premier point où leurs journaux ne concordent plus. Le chiffre surprenant n’est souvent pas le Sharpe. C’est le petit écart d’exécution ou de données qui fait que les deux expériences répondent à des questions différentes.
← Tous les articles


