Mille varianti di strategia. Uno Sharpe misurato di 2.0 per quella vincente. Un tasso di falsi positivi del 5%. Sembrano risultati solidi, finché non ci si chiede quanti tentativi siano serviti per trovarli. Con abbastanza tentativi, un backtest convincente può emergere dal solo rumore.
Il numero sorprendente non è lo Sharpe. È il numero di tentativi. Ogni finestra di un indicatore, soglia d’ingresso, scelta dell’universo e idea scartata offre un’altra possibilità di selezionare un risultato fortunato. Se nel processo di ricerca dimentichi quei tentativi, anche il calcolo della tua fiducia li dimentica.
Perché provare più strategie fa apparire migliore quella vincente?
Immagina di testare 1.000 strategie prive di un vero vantaggio. Ciascuna ha una probabilità del 5% di apparire statisticamente significativa secondo un test convenzionale. Nella ricerca reale questi tentativi non sono perfettamente indipendenti, ma l’intuizione di fondo resta valida: più candidati esamini, più è probabile che uno sembri eccezionale per puro caso.
Anche se ogni candidato fosse indipendente, la probabilità che almeno uno superi quella soglia del 5% sarebbe circa il 99.4%. Nella pratica, impostazioni di parametri vicine spesso si comportano in modo simile, quindi 1.000 varianti non equivalgono a 1.000 lanci indipendenti di una moneta. Ma raramente il numero effettivo di tentativi è uno solo.
Ecco una piccola trappola che ho visto nei notebook: un ricercatore prova lookback da 5 a 100, traccia la superficie dello Sharpe e poi presenta il picco dall’aspetto più pulito. La superficie è utile per capire la sensibilità. Ma il picco è anche il prodotto di una ricerca e merita meno credito di una soglia scelta prima dell’esperimento.
Che cosa conta come tentativo di ricerca?
Conta le decisioni influenzate dai risultati osservati. Un tentativo può essere un backtest eseguito con codice, ma anche una modifica manuale fatta dopo aver visto la curva azionaria. Se hai allargato uno stop perché l’impostazione precedente si era persa un rally, quella revisione ha usato informazioni del periodo di test.
| Azione di ricerca | Di solito conta come tentativo? | Perché |
|---|---|---|
| Provare un’altra soglia del segnale | Sì | Il risultato aiuta a selezionare un candidato |
| Cambiare l’intervallo di date dopo aver visto un drawdown | Sì | Il campione è stato scelto in risposta alla performance |
| Correggere un bug documentato nei dati | Di solito no | La modifica ripristina l’esperimento previsto |
| Eseguire la stessa strategia congelata su un nuovo periodo holdout | Per ora non è un nuovo tentativo di selezione | Lo diventa se ottimizzi sulla base di quel risultato |
Il confine richiede una valutazione. Correggere un refuso è diverso dal modificare una feature dopo aver notato dove ha fallito. Tieni un breve registro dei tentativi con ipotesi, modifica, periodo dei dati e risultato. Non deve essere elegante: un CSV con le date è meglio che ricostruire a memoria la ricerca tre mesi dopo.
Posso correggere il mio Sharpe per i test multipli?
Metodi come il Deflated Sharpe Ratio stimano quanta performance apparente potrebbe derivare dalla selezione tra molti candidati, tenendo conto di fattori come la distribuzione dei rendimenti e la dipendenza tra i tentativi. Sono strumenti diagnostici utili, non macchine che trasformano un processo di ricerca disordinato in certezza. I risultati dipendono dalle ipotesi e dalla credibilità del numero di tentativi dichiarato.
Per farsi un’idea, supponiamo che un ricercatore abbia testato 400 varianti, trovato uno Sharpe di 1.8 e stimi che i rendimenti presentino asimmetria marcata e code pesanti. Questo risultato dovrebbe superare una soglia più severa rispetto a uno Sharpe di 1.8 ottenuto con un unico test preregistrato. La correzione può indebolire notevolmente le prove, ma non può dirti che il vantaggio sia reale.
Registra la ricerca prima di doverla difendere: numero di candidati, intervalli dei parametri, periodi dei dati esaminati e qualsiasi revisione manuale. Se questi dettagli non sono noti, descrivi il backtest come esplorativo.
Che cosa dovrebbe succedere prima del paper trading?
Congela un candidato e definisci la valutazione successiva prima di eseguirla. Una sequenza utile consiste nello scegliere la strategia usando i dati di training, esaminarla sui dati di validation e poi riservare un periodo finale o una finestra di paper trading che non influisca sulla progettazione. Ogni fase risponde a una domanda diversa; modificare ripetutamente la strategia durante la fase finale la trasforma in altri dati di training.
Controlla anche se le impostazioni vicine raccontano la stessa storia. Un’ampia zona di risultati moderatamente positivi è di solito più credibile di un singolo picco sottilissimo, anche se la robustezza non rimedia a un modello di esecuzione difettoso. Commissioni, funding, impatto sul mercato e disponibilità degli strumenti devono comunque corrispondere alle condizioni che la strategia avrebbe potuto incontrare.
Il paper trading aggiunge prove sulla parità operativa: tempistiche, gestione degli ordini e comportamento atteso della pipeline di ricerca live. Non può cancellare la selezione già avvenuta. Mille backtest fortunati restano mille tentativi quando parte il primo ordine paper.
Quindi, quando un backtest riporta uno Sharpe di 2, chiedi di vedere la cronologia della ricerca accanto alla curva azionaria. Quante idee sono state provate? Quali risultati hanno modificato l’esperimento successivo? La risposta potrebbe essere la statistica più importante del report.
← Tutti gli articoli


