Un backtest est plus utile pour écarter une stratégie que pour en choisir une. Dès que vous vous appuyez sur les performances historiques pour départager plusieurs variantes, le backtest fait partie de l’expérience et la gagnante apparente commence à avoir un coût caché : le biais de sélection.
Cela semble paradoxal. Nous faisons des backtests pour savoir quelle stratégie fonctionne. Mais chaque décision guidée par les mêmes données historiques entame leur pouvoir probant. Modifiez la période de calcul, le seuil, l’univers, le jour de rééquilibrage ou la règle de stop après avoir vu les résultats, et vous avez posé une nouvelle question aux données. À force de questions, elles finiront par vous donner une réponse convaincante par hasard.
Pourquoi tester davantage de stratégies rend-il le meilleur résultat moins fiable ?
Imaginez que vous testiez 100 stratégies sans véritable avantage. Leurs rendements varieront malgré tout. Si leurs estimations de performance sont à peu près indépendantes et que le bruit suit une loi normale, le meilleur Sharpe sera positif, même si le vrai Sharpe de chaque stratégie est nul.
À titre indicatif, le maximum attendu de 100 tirages indépendants d’une loi normale standard se situe à 2.5 écarts-types au-dessus de la moyenne. Voyez cela comme une illustration, pas comme une correction à copier dans un rapport : les variantes réelles sont corrélées, les estimations de Sharpe ont leur propre erreur d’échantillonnage et les rendements ne suivent que rarement une loi normale idéale. Malgré ces réserves, le constat pratique reste valable. Plus vous examinez de stratégies candidates, plus le meilleur score risque de refléter un bruit favorable.
Et une « candidate » ne se limite pas à un backtest enregistré. Elle englobe chaque décision prise après l’examen d’un résultat : élargir l’univers parce que le graphique semble irrégulier, supprimer une année défavorable ou modifier une hypothèse de frais jusqu’à ce que la courbe remonte. Ces décisions comptent, même si personne ne leur a attribué de numéro de version.
Tenez un journal de recherche avant de tester la prochaine variante
Consignez l’ensemble de la recherche, y compris les idées écartées et la raison de chaque modification. Vous obtiendrez ainsi un récit plus fidèle de la part de sélection dans le résultat et il sera plus difficile de ne se souvenir que des essais prometteurs.
| Élément à consigner | Exemple | Pourquoi c’est important |
|---|---|---|
| Hypothèse | Le retournement à court terme est plus marqué après des mouvements exceptionnellement amples du perp BTC | Distingue l’idée des paramètres qui lui seront finalement attribués |
| Variante et horodatage | Signal sur 48 heures, 2026-10-09, exécution 014 | Quantifie la recherche et relie les résultats au code et aux données |
| Règle de sélection | Choisir selon le Sharpe net ; au moins 100 transactions | Précise ce que signifiait « meilleur » avant la comparaison |
| Variantes rejetées | Fenêtres de 12, 24 et 72 heures ; toutes conservées | Empêche que la gagnante visible fasse oublier ses concurrentes |
Un journal n’annule pas la recherche. Il la rend lisible, première étape pour évaluer le degré de confiance que mérite la stratégie gagnante.
Mettez de côté des données auxquelles le processus de recherche ne pourra plus revenir
Séparez les données dans le temps, puis protégez la période finale. Développez la stratégie sur une première période, prenez vos décisions à partir d’une période de validation, puis évaluez une seule fois la stratégie figée sur un échantillon de réserve ultérieur. Par exemple, vous pourriez utiliser 2018–2022 pour le développement, 2023 pour la validation, puis réserver 2024–2025. Ces dates ne sont qu’un exemple : le marché, l’horizon de la stratégie et la couverture des données doivent déterminer le découpage.
Précisez par écrit ce que signifie « figée » : signal, univers, dimensionnement, hypothèses d’exécution et règles éventuelles concernant les données manquantes. Si le résultat sur l’échantillon de réserve est décevant et que vous ajustez la stratégie en fonction de celui-ci, cette période est devenue une période de validation. La prochaine évaluation honnête nécessitera de nouvelles données.
C’est aussi là que les petits échantillons posent problème. Une stratégie qui n’effectue que 18 transactions sur la période de réserve ne permet pas de tirer une conclusion précise. Présentez le nombre de transactions et l’incertitude avec les statistiques de rendement ; une simple moyenne peut donner l’impression qu’un échantillon réduit est concluant.
Cela signifie-t-il que les backtests ne servent à rien pour choisir des stratégies ?
Non. Les critiques ont raison de dire que les échantillons de réserve stricts peuvent être coûteux : les marchés évoluent, les historiques sont courts et une période laissée de côté peut ne représenter qu’un seul régime inhabituel. Un processus walk-forward soigneusement conçu peut montrer comment se comporte une stratégie à mesure que l’historique disponible avance. Cela ne rend pas pour autant les ajustements répétés gratuits. Si vous examinez chaque fenêtre et révisez la stratégie, ces fenêtres ont influencé la recherche.
Utilisez les backtests pour mettre au jour les modes d’échec, comparer quelques idées fondées sur un mécanisme de marché et vérifier si les résultats résistent à des hypothèses plausibles de frais, de funding, d’impact et de paramètres. Tenez un journal. Préservez un échantillon de réserve final. Faites ensuite passer une version prometteuse et figée en paper trading, où les écarts opérationnels peuvent apparaître.
La réponse la plus utile d’un backtest est souvent : « Cette idée échoue dans des conditions que nous pouvons déjà observer. » Quand il affirme : « C’est la meilleure stratégie », demandez-vous combien d’autres réponses vous lui avez demandé de fournir.
← Tous les articles


