10 de setembro de 2026 · investigação

O teu rácio de Sharpe passou todos os testes. Ainda pode ser uma coincidência.

O teu rácio de Sharpe passou todos os testes. Ainda pode ser uma coincidência.

Mil variantes de estratégia. Um Sharpe medido de 2.0 para a vencedora. Uma taxa de falsos positivos de 5%. Estes números parecem indicar um resultado sólido, até perguntares quantas tentativas foram necessárias para o encontrar. Com tentativas suficientes, até um backtest convincente pode surgir apenas do ruído.

O número surpreendente não é o Sharpe. É o número de tentativas. Cada janela de indicador, limiar de entrada, escolha de universo e ideia descartada representa mais uma oportunidade para selecionar um resultado sortudo. Se o teu processo de investigação se esquece dessas tentativas, os teus cálculos de confiança também se esquecem delas.

Porque é que testar mais estratégias faz a vencedora parecer melhor?

Imagina testar 1,000 estratégias sem qualquer vantagem real. Cada uma tem 5% de probabilidade de parecer estatisticamente significativa num teste convencional. Na investigação real, essas tentativas não são perfeitamente independentes, mas a intuição básica mantém-se: quanto mais candidatos analisares, maior a probabilidade de um deles parecer excecional por acaso.

Mesmo que todos os candidatos fossem independentes, a probabilidade de pelo menos um ultrapassar esse limiar de 5% seria de cerca de 99.4%. Na prática, configurações de parâmetros próximas tendem a comportar-se de forma semelhante, por isso 1,000 variantes não equivalem a 1,000 lançamentos de moeda independentes. Mas o número efetivo de tentativas raramente é apenas um.

Eis uma armadilha pequena que já encontrei em notebooks: um investigador testa períodos retrospetivos de 5 a 100, traça a superfície de Sharpe e depois apresenta o pico que parece mais nítido. A superfície é útil para compreender a sensibilidade. O pico também resulta de uma pesquisa e merece menos crédito do que um limiar escolhido antes da experiência.

O que conta como tentativa de investigação?

Conta as decisões influenciadas pelos resultados observados. Uma tentativa pode ser um backtest codificado, mas também pode ser uma alteração manual feita depois de veres a curva de capital. Se alargaste um stop porque a configuração anterior não apanhou uma subida, essa revisão usou informação do período de teste.

Ação de investigaçãoConta normalmente como tentativa?Porquê
Testar outro limiar de sinalSimO resultado ajuda a selecionar um candidato
Alterar o intervalo de datas depois de observar uma quedaSimA amostra foi escolhida em função do desempenho
Corrigir um erro de dados documentadoNormalmente, nãoA alteração repõe a experiência pretendida
Executar a mesma estratégia congelada num novo período de reservaAinda não é uma nova tentativa de seleçãoPassa a contar se ajustares a estratégia com base nesse resultado

Há alguma margem de interpretação. Corrigir um erro de digitação é diferente de alterar uma característica depois de perceberes onde falhou. Mantém um registo breve das tentativas, com a hipótese, a alteração, o período de dados e o resultado. Não precisa de ser sofisticado; um CSV datado é melhor do que tentares reconstruir a pesquisa de memória três meses depois.

Posso corrigir o meu Sharpe para testes múltiplos?

Métodos como o Deflated Sharpe Ratio estimam quanto do desempenho aparente pode resultar da seleção entre muitos candidatos, tendo em conta fatores como a distribuição dos retornos e a dependência entre tentativas. São ferramentas de diagnóstico úteis, não uma máquina que transforma um processo de investigação confuso em certeza. Os resultados dependem dos pressupostos e da credibilidade do número de tentativas.

Para teres uma ideia aproximada, imagina que um investigador testou 400 variantes, encontrou um Sharpe de 1.8 e estima que os retornos apresentam assimetria acentuada e caudas pesadas. Esse resultado deve enfrentar um limiar mais exigente do que um Sharpe de 1.8 obtido num único teste pré-registado. A correção pode enfraquecer consideravelmente as evidências; não pode dizer-te que a vantagem é real.

Regista a pesquisa antes de teres de a justificar: número de candidatos, intervalos de parâmetros, períodos de dados analisados e quaisquer revisões manuais. Se não conheceres esses detalhes, descreve o backtest como exploratório.

O que deve acontecer antes da negociação em paper?

Congela um candidato e define a próxima avaliação antes de a executar. Uma sequência útil consiste em escolher a estratégia com dados de treino, analisá-la com dados de validação e, depois, reservar um período final ou uma janela de negociação em paper que não influencie o desenho. Cada etapa responde a uma pergunta diferente; se ajustares repetidamente a estratégia na etapa final, transformas esses dados em mais dados de treino.

Analisa também se configurações próximas contam a mesma história. Em geral, uma zona ampla de resultados moderadamente positivos é mais credível do que um único pico muito estreito, embora a robustez não corrija um modelo de execução defeituoso. As comissões, o funding, o impacto e a disponibilidade dos instrumentos continuam a ter de corresponder às condições que a estratégia poderia ter enfrentado.

A negociação em paper acrescenta evidências sobre a paridade operacional: os tempos, o tratamento das ordens e se o pipeline de investigação em produção se comporta como esperado. Não apaga a seleção que já ocorreu. Mil backtests sortudos continuam a ser mil tentativas quando a primeira ordem em paper é enviada.

Por isso, quando um backtest apresenta um Sharpe de 2, pede o histórico da investigação juntamente com a curva de capital. Quantas ideias foram testadas? Que resultados alteraram a experiência seguinte? A resposta pode ser a estatística mais importante do relatório.

sobreajuste do backtestrácio de Sharpetestes múltiplosinvestigação de estratégiaswalk-forward
← Todos os artigos