1 000 variantes de stratégie. Un Sharpe mesuré de 2.0 pour la gagnante. Un taux de faux positifs de 5 %. Ces chiffres semblent indiquer un résultat solide, jusqu’à ce qu’on demande combien de tentatives ont été nécessaires pour le trouver. Avec suffisamment d’essais, un backtest convaincant peut surgir du seul bruit.
Le chiffre surprenant, ce n’est pas le Sharpe. C’est le nombre d’essais. Chaque fenêtre d’indicateur, seuil d’entrée, choix d’univers et idée abandonnée représente une nouvelle occasion de sélectionner un résultat chanceux. Si votre processus de recherche oublie ces tentatives, votre calcul de confiance les oublie lui aussi.
Pourquoi le fait d’essayer davantage de stratégies donne-t-il une meilleure apparence à la gagnante ?
Imaginez tester 1 000 stratégies sans véritable avantage. Chacune a 5 % de chances de sembler statistiquement significative selon un test classique. Dans la recherche réelle, ces essais ne sont pas parfaitement indépendants, mais l’idée de base reste valable : plus vous examinez de candidates, plus il est probable que l’une d’elles semble exceptionnelle par hasard.
Même si chaque candidate était indépendante, la probabilité qu’au moins une dépasse ce seuil de 5 % serait d’environ 99.4 %. En pratique, des paramètres voisins donnent souvent des résultats similaires : 1 000 variantes ne correspondent donc pas à 1 000 tirages indépendants à pile ou face. Mais le nombre effectif de tentatives est rarement égal à 1, lui aussi.
Voici un petit piège que j’ai vu dans des notebooks : une personne teste des périodes de rétrospection de 5 à 100, trace la surface des ratios de Sharpe, puis présente le pic qui semble le plus net. Cette surface est utile pour comprendre la sensibilité. Le pic est aussi le produit d’une recherche, et il mérite moins de crédit qu’un seuil choisi avant l’expérience.
Qu’est-ce qui compte comme un essai de recherche ?
Comptez les décisions influencées par les résultats observés. Un essai peut être un backtest codé, mais aussi une modification manuelle effectuée après avoir vu la courbe de capital. Si vous avez élargi un stop parce que le réglage précédent vous avait fait manquer un rallye, cette révision a utilisé des informations de la période de test.
| Action de recherche | Compte généralement comme un essai ? | Pourquoi |
|---|---|---|
| Tester un autre seuil de signal | Oui | Le résultat aide à sélectionner une candidate |
| Modifier la période après avoir constaté un drawdown | Oui | L’échantillon a été choisi en fonction des performances |
| Corriger un bug de données documenté | Généralement non | La modification rétablit l’expérience prévue |
| Exécuter la même stratégie figée sur une nouvelle période de réserve | Pas encore de nouvel essai de sélection | Cela en devient un si vous ajustez la stratégie en fonction du résultat |
La frontière dépend du jugement. Corriger une faute de frappe, c’est différent de modifier une caractéristique après avoir remarqué où elle a échoué. Tenez un bref journal des essais : hypothèse, modification, période de données et résultat. Pas besoin qu’il soit élégant ; un CSV daté vaut mieux que de reconstituer votre recherche de mémoire trois mois plus tard.
Puis-je corriger mon Sharpe pour tenir compte des tests multiples ?
Des méthodes comme le Deflated Sharpe Ratio estiment quelle part des performances apparentes pourrait s’expliquer par la sélection parmi de nombreuses candidates, tout en tenant compte de facteurs tels que la distribution des rendements et la dépendance entre les essais. Elles fournissent des diagnostics utiles, mais ne transforment pas un processus de recherche désordonné en certitude. Leurs résultats dépendent des hypothèses retenues et de la fiabilité du nombre d’essais déclaré.
Pour se faire une idée, supposons qu’une personne ait testé 400 variantes, obtenu un Sharpe de 1.8 et estime que les rendements présentent une forte asymétrie et des queues épaisses. Ce résultat doit franchir un seuil plus exigeant qu’un Sharpe de 1.8 issu d’un seul test préenregistré. La correction peut affaiblir considérablement les preuves ; elle ne peut pas vous dire que l’avantage est réel.
Consignez la recherche avant d’avoir à la défendre : nombre de candidates, plages de paramètres, périodes de données consultées et révisions manuelles. Si ces détails sont inconnus, présentez le backtest comme exploratoire.
Que faut-il faire avant le paper trading ?
Figez une candidate et définissez la prochaine évaluation avant de la lancer. Une séquence utile consiste à choisir la stratégie à l’aide des données d’entraînement, à l’examiner sur les données de validation, puis à réserver une période finale ou une fenêtre de paper trading qui ne sert pas à modifier la conception. Chaque étape répond à une question différente ; ajuster sans cesse la stratégie en fonction de l’étape finale revient à en faire de nouvelles données d’entraînement.
Vérifiez aussi si les réglages voisins racontent la même histoire. Une large zone de résultats positifs mais modérés est généralement plus crédible qu’un pic isolé et très étroit, même si la robustesse ne corrige pas un modèle d’exécution défectueux. Les frais, le funding, l’impact et la disponibilité des instruments doivent toujours correspondre aux conditions auxquelles la stratégie aurait pu être confrontée.
Le paper trading apporte des éléments sur la cohérence opérationnelle : le timing, la gestion des ordres et le comportement attendu du pipeline de recherche en production. Il ne peut pas effacer la sélection déjà effectuée. Quand le premier ordre en paper trading est envoyé, 1 000 backtests chanceux restent 1 000 tentatives.
Alors, lorsqu’un backtest affiche un Sharpe de 2, demandez à consulter l’historique de recherche à côté de la courbe de capital. Combien d’idées ont été essayées ? Quels résultats ont modifié l’expérience suivante ? La réponse pourrait être la statistique la plus importante du rapport.
← Tous les articles


