9 de Outubro de 2026 · pesquisa

Um backtest melhor pode piorar sua pesquisa de estratégias

Um backtest melhor pode piorar sua pesquisa de estratégias

Um backtest é melhor para rejeitar uma estratégia do que para selecionar uma. A partir do momento em que você usa o desempenho histórico para escolher entre muitas variantes, o backtest passa a fazer parte do experimento, e a aparente vencedora começa a ter um custo oculto: viés de seleção.

Isso parece contraditório. Fazemos backtests porque queremos descobrir qual estratégia funciona. Mas cada escolha orientada pelo mesmo histórico consome parte das evidências. Se você muda o período de análise, o limite, o universo, o dia de rebalanceamento ou a regra de stop depois de ver os resultados, fez outra pergunta aos dados. Mais cedo ou mais tarde, eles já terão ouvido perguntas suficientes para dar uma resposta convincente por acaso.

Por que testar mais estratégias torna o melhor resultado menos confiável?

Imagine testar 100 estratégias sem vantagem real. Ainda assim, os retornos serão diferentes. Se as estimativas de desempenho forem mais ou menos independentes e o ruído tiver distribuição normal, o melhor Sharpe entre elas será positivo, mesmo que o Sharpe verdadeiro de cada estratégia seja zero.

Uma aproximação grosseira para o máximo esperado de 100 amostras independentes de uma normal padrão é 2.5 desvios-padrão acima da média. Considere isso uma ilustração, não um ajuste para copiar e colar num relatório: variantes de estratégia reais são correlacionadas, as estimativas de Sharpe têm seu próprio erro amostral e os retornos raramente se comportam como amostras normais bem-comportadas. A conclusão prática continua válida apesar dessas ressalvas. Quanto mais candidatos você examina, maior a chance de a pontuação máxima refletir ruído favorável.

E um “candidato” não é apenas um backtest salvo. É cada escolha feita depois de olhar um resultado: ampliar o universo porque o gráfico parece irregular, excluir um ano que prejudica os resultados ou mudar uma hipótese de taxas até a curva se recuperar. Essas decisões contam, mesmo que ninguém lhes dê um número de versão.

Mantenha um registro da pesquisa antes de testar a próxima variante

Registre toda a busca, incluindo as ideias descartadas e o motivo de cada mudança. Assim, você terá um relato mais honesto do quanto o resultado foi selecionado e será mais difícil lembrar apenas dos testes atraentes.

RegistroExemploPor que importa
HipóteseA reversão de curto prazo é mais forte após movimentos excepcionalmente grandes em perpétuos de BTCSepara a ideia dos parâmetros definidos posteriormente
Variante e data e horaSinal de 48 horas, 2026-10-09, execução 014Conta a busca e vincula os resultados ao código e aos dados
Regra de seleçãoEscolher pelo Sharpe líquido; mínimo de 100 operaçõesMostra o que “melhor” significava antes da comparação
Variantes rejeitadasJanelas de 12, 24 e 72 horas; todas mantidasImpede que a vencedora visível apague a concorrência

Um registro não desfaz a busca. Ele a torna compreensível, o primeiro passo para avaliar quanta confiança a vencedora merece.

Reserve dados que o processo de pesquisa não possa consultar repetidamente

Divida os dados por período e proteja o trecho final. Desenvolva a estratégia em um intervalo, tome decisões usando um intervalo de validação e avalie a estratégia congelada uma única vez em um conjunto de dados reservado posterior. Por exemplo, você poderia usar 2018–2022 para desenvolvimento, 2023 para validação e reservar 2024–2025. Essas datas são apenas um esboço: o mercado, o horizonte da estratégia e a cobertura dos dados devem determinar a divisão.

Defina por escrito o que significa “congelada”: sinal, universo, dimensionamento, hipóteses de execução e quaisquer regras para dados ausentes. Se o conjunto reservado decepcionar e você ajustar a estratégia com base nele, esse período terá se tornado dado de validação. A próxima avaliação honesta precisará de evidências novas.

É também aqui que amostras pequenas pesam. Uma estratégia que opera 18 vezes no período reservado não permite um veredito preciso. Informe o número de operações e a incerteza junto com as estatísticas de retorno; uma única média pode fazer uma amostra pequena parecer conclusiva.

100variantes nulas ilustrativas testadas
2.5σpontuação máxima esperada aproximada, sob hipóteses simplificadoras
1avaliação do conjunto reservado depois que a estratégia é congelada

Isso quer dizer que backtests são inúteis para escolher estratégias?

Não. Os críticos têm razão ao dizer que conjuntos de dados reservados estritos podem ser um desperdício: os mercados mudam, os históricos são curtos e um período intocado pode representar apenas um regime atípico. Um processo walk-forward bem planejado pode mostrar como uma estratégia se comporta à medida que o histórico disponível avança. Ainda assim, isso não torna gratuitas as rodadas repetidas de ajuste. Se você examina cada janela e revisa a estratégia, essas janelas influenciaram a pesquisa.

Use backtests para revelar modos de falha, comparar um número pequeno de ideias fundamentadas em mecanismos de mercado e verificar se os resultados resistem a hipóteses plausíveis de taxas, funding, impacto e mudanças nos parâmetros. Mantenha um registro. Preserve um conjunto de dados final reservado. Depois, leve uma versão promissora e congelada para paper trading, onde incompatibilidades operacionais podem aparecer.

A resposta mais forte de um backtest costuma ser: “Esta ideia falha em condições que já conseguimos identificar.” Quando ele diz “Esta é a melhor estratégia”, pergunte quantas outras respostas você pediu a ele.

pesquisa de estratégiasbacktestingsobreajustewalk-forwardpaper trading
← Todos os artigos