Um backtest é melhor a rejeitar uma estratégia do que a selecioná-la. A partir do momento em que usa o desempenho histórico para escolher entre muitas variantes, o backtest passa a fazer parte da experiência, e a aparente vencedora começa a ter um custo oculto: viés de seleção.
Isto parece ao contrário. Fazemos backtests porque queremos saber que estratégia funciona. Mas cada escolha orientada pelo mesmo histórico consome parte da evidência disponível. Se alterar o período de análise, o limiar, o universo, o dia de rebalanceamento ou a regra de stop depois de ver os resultados, está a fazer outra pergunta aos dados. Mais cedo ou mais tarde, já lhes fez perguntas suficientes para obter, por acaso, uma resposta convincente.
Porque é que testar mais estratégias torna o melhor resultado menos fiável?
Imagine que testa 100 estratégias sem vantagem real. Mesmo assim, os respetivos retornos serão diferentes. Se as estimativas de desempenho forem aproximadamente independentes e o ruído tiver distribuição normal, o melhor Sharpe entre elas será positivo, apesar de o Sharpe verdadeiro de cada estratégia ser zero.
Uma aproximação grosseira para o máximo esperado de 100 observações independentes de uma normal padrão é 2.5 desvios-padrão acima da média. Encare isto como uma ilustração, não como uma correção que possa copiar para um relatório: as variantes de estratégias reais estão correlacionadas, as estimativas de Sharpe têm o seu próprio erro amostral e os retornos raramente se comportam como observações normais perfeitas. Apesar destas ressalvas, a conclusão prática mantém-se. Quanto mais candidatas analisar, maior é a probabilidade de a pontuação mais alta refletir ruído favorável.
E uma «candidata» não é apenas um backtest guardado. É cada escolha feita depois de observar um resultado: alargar o universo porque o gráfico parece irregular, excluir um ano desfavorável ou alterar uma estimativa de comissões até a curva recuperar. Estas decisões contam, mesmo que ninguém lhes tenha atribuído um número de versão.
Mantenha um registo de investigação antes de testar a próxima variante
Registe toda a pesquisa, incluindo as ideias descartadas e o motivo de cada alteração. Assim, terá um relato mais honesto do grau de seleção do resultado e será mais difícil lembrar-se apenas dos testes mais atraentes.
| Registo | Exemplo | Importância |
|---|---|---|
| Hipótese | A reversão de curto prazo é mais forte após movimentos invulgarmente grandes nos perpétuos de BTC | Separa a ideia das definições de parâmetros a que se chegou |
| Variante e data/hora | Sinal de 48 horas, 2026-10-09, execução 014 | Conta as pesquisas e associa os resultados ao código e aos dados |
| Regra de seleção | Escolher pelo Sharpe líquido; mínimo de 100 transações | Mostra o que significava «melhor» antes da comparação |
| Variantes rejeitadas | Janelas de 12, 24 e 72 horas; todas mantidas | Impede que a vencedora visível apague a concorrência |
Um registo não desfaz a pesquisa. Torna-a compreensível, o primeiro passo para avaliar quanta confiança merece a vencedora.
Reserve dados que o processo de investigação não possa reutilizar continuamente
Divida os dados por períodos e proteja o período final. Desenvolva a estratégia num intervalo, tome decisões com base num intervalo de validação e avalie a estratégia congelada uma única vez num período de teste posterior. Por exemplo, poderia usar 2018–2022 para desenvolvimento, 2023 para validação e reservar 2024–2025. Estas datas são apenas um esboço: a divisão deve ser determinada pelo mercado, pelo horizonte da estratégia e pela cobertura dos dados.
Registe por escrito o que significa «congelada»: sinal, universo, dimensionamento, pressupostos de execução e quaisquer regras para dados em falta. Se o período de teste desiludir e ajustar a estratégia com base nele, esse período passou a ser dados de validação. A próxima avaliação honesta precisa de evidência nova.
É também aqui que as amostras pequenas pesam. Uma estratégia com 18 transações num período de teste ainda não permite uma conclusão precisa. Apresente o número de transações e a incerteza juntamente com as estatísticas de retorno; uma única média pode fazer uma amostra reduzida parecer conclusiva.
Quer isto dizer que os backtests são inúteis para escolher estratégias?
Não. Os críticos têm razão ao dizer que períodos de teste rigorosamente reservados podem ser um desperdício: os mercados mudam, os históricos são curtos e um período intocado pode representar apenas um regime invulgar. Um processo walk-forward cuidadosamente concebido pode mostrar como uma estratégia se comporta à medida que o histórico disponível avança. Ainda assim, isso não torna gratuitas as afinações repetidas. Se analisar cada janela e rever a estratégia, essas janelas influenciaram a investigação.
Use backtests para revelar modos de falha, comparar um pequeno número de ideias sustentadas por um mecanismo de mercado e testar se os resultados resistem a comissões, funding, impacto e alterações de parâmetros plausíveis. Mantenha um registo. Preserve um período de teste final. Depois, leve uma versão promissora e congelada para paper trading, onde podem surgir discrepâncias operacionais.
A resposta mais forte de um backtest é muitas vezes: «Esta ideia falha em condições que já conseguimos observar.» Quando diz «Esta é a melhor estratégia», pergunte quantas outras respostas lhe pediram.
← Todos os artigos


