9 de outubro de 2026 · investigação

Um backtest melhor pode piorar a sua investigação de estratégias

Um backtest melhor pode piorar a sua investigação de estratégias

Um backtest é melhor a rejeitar uma estratégia do que a selecioná-la. A partir do momento em que usa o desempenho histórico para escolher entre muitas variantes, o backtest passa a fazer parte da experiência, e a aparente vencedora começa a ter um custo oculto: viés de seleção.

Isto parece ao contrário. Fazemos backtests porque queremos saber que estratégia funciona. Mas cada escolha orientada pelo mesmo histórico consome parte da evidência disponível. Se alterar o período de análise, o limiar, o universo, o dia de rebalanceamento ou a regra de stop depois de ver os resultados, está a fazer outra pergunta aos dados. Mais cedo ou mais tarde, já lhes fez perguntas suficientes para obter, por acaso, uma resposta convincente.

Porque é que testar mais estratégias torna o melhor resultado menos fiável?

Imagine que testa 100 estratégias sem vantagem real. Mesmo assim, os respetivos retornos serão diferentes. Se as estimativas de desempenho forem aproximadamente independentes e o ruído tiver distribuição normal, o melhor Sharpe entre elas será positivo, apesar de o Sharpe verdadeiro de cada estratégia ser zero.

Uma aproximação grosseira para o máximo esperado de 100 observações independentes de uma normal padrão é 2.5 desvios-padrão acima da média. Encare isto como uma ilustração, não como uma correção que possa copiar para um relatório: as variantes de estratégias reais estão correlacionadas, as estimativas de Sharpe têm o seu próprio erro amostral e os retornos raramente se comportam como observações normais perfeitas. Apesar destas ressalvas, a conclusão prática mantém-se. Quanto mais candidatas analisar, maior é a probabilidade de a pontuação mais alta refletir ruído favorável.

E uma «candidata» não é apenas um backtest guardado. É cada escolha feita depois de observar um resultado: alargar o universo porque o gráfico parece irregular, excluir um ano desfavorável ou alterar uma estimativa de comissões até a curva recuperar. Estas decisões contam, mesmo que ninguém lhes tenha atribuído um número de versão.

Mantenha um registo de investigação antes de testar a próxima variante

Registe toda a pesquisa, incluindo as ideias descartadas e o motivo de cada alteração. Assim, terá um relato mais honesto do grau de seleção do resultado e será mais difícil lembrar-se apenas dos testes mais atraentes.

RegistoExemploImportância
HipóteseA reversão de curto prazo é mais forte após movimentos invulgarmente grandes nos perpétuos de BTCSepara a ideia das definições de parâmetros a que se chegou
Variante e data/horaSinal de 48 horas, 2026-10-09, execução 014Conta as pesquisas e associa os resultados ao código e aos dados
Regra de seleçãoEscolher pelo Sharpe líquido; mínimo de 100 transaçõesMostra o que significava «melhor» antes da comparação
Variantes rejeitadasJanelas de 12, 24 e 72 horas; todas mantidasImpede que a vencedora visível apague a concorrência

Um registo não desfaz a pesquisa. Torna-a compreensível, o primeiro passo para avaliar quanta confiança merece a vencedora.

Reserve dados que o processo de investigação não possa reutilizar continuamente

Divida os dados por períodos e proteja o período final. Desenvolva a estratégia num intervalo, tome decisões com base num intervalo de validação e avalie a estratégia congelada uma única vez num período de teste posterior. Por exemplo, poderia usar 2018–2022 para desenvolvimento, 2023 para validação e reservar 2024–2025. Estas datas são apenas um esboço: a divisão deve ser determinada pelo mercado, pelo horizonte da estratégia e pela cobertura dos dados.

Registe por escrito o que significa «congelada»: sinal, universo, dimensionamento, pressupostos de execução e quaisquer regras para dados em falta. Se o período de teste desiludir e ajustar a estratégia com base nele, esse período passou a ser dados de validação. A próxima avaliação honesta precisa de evidência nova.

É também aqui que as amostras pequenas pesam. Uma estratégia com 18 transações num período de teste ainda não permite uma conclusão precisa. Apresente o número de transações e a incerteza juntamente com as estatísticas de retorno; uma única média pode fazer uma amostra reduzida parecer conclusiva.

100variantes nulas ilustrativas analisadas
2.5σmelhor pontuação esperada aproximada, sob pressupostos simplificadores
1avaliação do período de teste após congelar a estratégia

Quer isto dizer que os backtests são inúteis para escolher estratégias?

Não. Os críticos têm razão ao dizer que períodos de teste rigorosamente reservados podem ser um desperdício: os mercados mudam, os históricos são curtos e um período intocado pode representar apenas um regime invulgar. Um processo walk-forward cuidadosamente concebido pode mostrar como uma estratégia se comporta à medida que o histórico disponível avança. Ainda assim, isso não torna gratuitas as afinações repetidas. Se analisar cada janela e rever a estratégia, essas janelas influenciaram a investigação.

Use backtests para revelar modos de falha, comparar um pequeno número de ideias sustentadas por um mecanismo de mercado e testar se os resultados resistem a comissões, funding, impacto e alterações de parâmetros plausíveis. Mantenha um registo. Preserve um período de teste final. Depois, leve uma versão promissora e congelada para paper trading, onde podem surgir discrepâncias operacionais.

A resposta mais forte de um backtest é muitas vezes: «Esta ideia falha em condições que já conseguimos observar.» Quando diz «Esta é a melhor estratégia», pergunte quantas outras respostas lhe pediram.

investigação de estratégiasbacktestingsobreajustewalk-forwardpaper trading
← Todos os artigos