Mil variantes de estratégia. Um Sharpe medido de 2.0 para a vencedora. Uma taxa de falsos positivos de 5%. Esses números parecem um resultado sólido até você perguntar quantas tentativas foram necessárias para encontrá-lo. Com tentativas suficientes, um backtest convincente pode surgir apenas do ruído.
O número surpreendente não é o Sharpe. É a quantidade de tentativas. Cada janela de indicador, limite de entrada, escolha de universo e ideia descartada é mais uma chance de selecionar um resultado sortudo. Se o seu processo de pesquisa esquece essas tentativas, o cálculo de confiança também as esquece.
Por que testar mais estratégias faz a vencedora parecer melhor?
Imagine testar 1,000 estratégias sem nenhuma vantagem real. Cada uma tem 5% de chance de parecer estatisticamente significativa em um teste convencional. Na pesquisa real, essas tentativas não são perfeitamente independentes, mas a intuição básica continua válida: quanto mais candidatas você examina, maior a probabilidade de uma delas parecer excepcional por acaso.
Mesmo que todas as candidatas fossem independentes, a probabilidade de pelo menos uma superar esse limite de 5% seria de cerca de 99.4%. Na prática, configurações de parâmetros próximas costumam se comportar de maneira semelhante, então 1,000 variantes não equivalem a 1,000 lançamentos independentes de moeda. Mas o número efetivo de tentativas raramente é apenas 1.
Aqui vai uma armadilha comum que já vi em notebooks: alguém testa períodos de lookback de 5 a 100, plota a superfície de Sharpe e depois apresenta o pico que parece mais limpo. A superfície ajuda a entender a sensibilidade. O pico também é produto de uma busca e merece menos crédito do que um limite definido antes do experimento.
O que conta como uma tentativa de pesquisa?
Conte as decisões influenciadas pelos resultados observados. Uma tentativa pode ser um backtest codificado, mas também pode ser uma alteração manual feita depois de ver a curva de capital. Se você ampliou um stop porque a configuração anterior deixou passar uma alta, essa revisão usou informações do período de teste.
| Ação de pesquisa | Geralmente conta como tentativa? | Por quê |
|---|---|---|
| Testar outro limite de sinal | Sim | O resultado ajuda a selecionar uma candidata |
| Alterar o intervalo de datas depois de ver um drawdown | Sim | A amostra foi escolhida em resposta ao desempenho |
| Corrigir um erro de dados documentado | Geralmente não | A alteração restaura o experimento pretendido |
| Executar a mesma estratégia congelada em um novo período de holdout | Ainda não é uma nova tentativa de seleção | Passa a contar se você ajustar a estratégia com base nesse resultado |
Há uma dose de julgamento nessa distinção. Corrigir um erro de digitação é diferente de mudar um recurso depois de perceber onde ele falhou. Mantenha um registro breve das tentativas, com a hipótese, a alteração, o período de dados e o resultado. Não precisa ser elaborado; um CSV datado é melhor do que tentar reconstruir sua busca de memória três meses depois.
Posso corrigir meu Sharpe para testes múltiplos?
Métodos como o Deflated Sharpe Ratio estimam quanto do desempenho aparente poderia ser resultado da seleção entre muitas candidatas, levando em conta fatores como a distribuição dos retornos e a dependência entre tentativas. São diagnósticos úteis, não uma máquina que transforma um processo de pesquisa confuso em certeza. Os resultados dependem das premissas e da credibilidade da quantidade de tentativas informada.
Para ter uma ideia aproximada, suponha que alguém tenha testado 400 variantes, encontrado um Sharpe de 1.8 e estimado que os retornos têm assimetria e caudas pesadas consideráveis. Esse resultado deve passar por um crivo mais rigoroso do que um Sharpe de 1.8 obtido em um único teste pré-registrado. A correção pode enfraquecer bastante as evidências; ela não pode dizer que a vantagem é real.
Registre a busca antes de precisar justificá-la: quantidade de candidatas, intervalos de parâmetros, períodos de dados examinados e revisões manuais. Se esses detalhes forem desconhecidos, descreva o backtest como exploratório.
O que deve acontecer antes do paper trading?
Congele uma candidata e defina a próxima avaliação antes de executá-la. Uma sequência útil é escolher a estratégia com dados de treinamento, examiná-la com dados de validação e, em seguida, reservar um período final ou uma janela de paper trading que não retroalimente o desenvolvimento. Cada etapa responde a uma pergunta diferente; ajustar repetidamente a estratégia na etapa final a transforma em mais dados de treinamento.
Verifique também se configurações próximas contam a mesma história. Uma região ampla de resultados moderadamente positivos costuma ser mais confiável do que um pico isolado e estreito, embora robustez não corrija um modelo de execução falho. Taxas, funding, impacto e disponibilidade dos instrumentos ainda precisam corresponder ao que a estratégia poderia ter enfrentado.
O paper trading acrescenta evidências sobre a paridade operacional: o timing, o tratamento das ordens e se o pipeline de pesquisa em produção se comporta como esperado. Ele não apaga a seleção que já ocorreu. Mil backtests sortudos continuam sendo mil tentativas quando a primeira ordem de paper trading é enviada.
Então, quando um backtest apresenta um Sharpe de 2, peça para ver o histórico da pesquisa ao lado da curva de capital. Quantas ideias foram testadas? Quais resultados mudaram o experimento seguinte? A resposta pode ser a estatística mais importante do relatório.
← Todos os artigos


