30 de Agosto de 2026 · estatística

Quantas operações um backtest precisa ter para o Sharpe significar alguma coisa?

Quantas operações um backtest precisa ter para o Sharpe significar alguma coisa?

Esta é a pergunta que mais me fazem, de uma forma ou de outra, pessoas que acabaram de concluir sua primeira estratégia: quantas operações preciso fazer até o resultado ser real? Geralmente vem acompanhada de um número. "Tenho 1,200 operações, isso basta, né?" E a resposta sincera irrita todo mundo, porque não tem nada a ver com a quantidade de operações.

Aqui está tudo em uma linha; depois, vou passar o resto do post explicando por que isso dói.

1/√Terro padrão de um Sharpe anualizado, T em anos
±0.88intervalo de 95% em torno de qualquer Sharpe medido ao longo de 5 anos
1.4Sharpe que a mais sortuda de 100 estratégias sem sinal apresenta nesses mesmos 5 anos

Qual é o erro padrão de um índice de Sharpe?

Para um Sharpe calculado com n retornos periódicos, supondo que sejam independentes e aproximadamente normais, o erro amostral é:

SE(s) ≈ √((1 + s²/2) / n)

em que s é o Sharpe medido na mesma frequência. Anualize os dois lados e chegamos a uma expressão simples. Com k observações por ano e T anos, o Sharpe anualizado S tem:

SE(S) ≈ √((1 + S²/(2k)) / T)

Repare nesse 2k no denominador. Para retornos diários, k = 252; assim, até um Sharpe de 2 contribui com 4/504 ≈ 0.008 para o numerador. O termo inteiro se reduz a 1. O erro padrão de um Sharpe anualizado é aproximadamente 1/√T, em que T é o número de anos-calendário de dados. Ele quase não depende do próprio Sharpe, não depende da frequência de amostragem e definitivamente não depende de quantas operações você fez.

Então:

Anos de dadosEP(Sharpe)IC de 95% se você mediu 1.5
11.00−0.46 a 3.46
20.710.11 a 2.89
30.580.37 a 2.63
50.450.62 a 2.38
100.320.88 a 2.12

Um backtest com Sharpe 1.5 ao longo de dois anos de histórico não consegue se distinguir estatisticamente de uma moeda lançada ao acaso com nível de confiança de 95%. Essa é a situação de partida da maior parte da pesquisa em cripto, porque os dados limpos, corrigidos para viés de sobrevivência e com taxas precisas da maioria das pessoas começam por volta de 2022, e metade dos símbolos interessantes nem existia antes de 2023.

Mas eu tenho 40,000 operações. Isso não resolve?

Não, e esse é o equívoco que mais quero desfazer.

A quantidade de operações e o tamanho da amostra são grandezas diferentes, e só uma delas aparece na fórmula. Se sua estratégia dispara 40,000 vezes em seis meses, você tem T = 0.5 e EP ≈ 1.41. Seu intervalo de 95% para um Sharpe medido de 2.0 vai de −0.8 a 4.8. Com quarenta mil operações, a conclusão sincera é: "pode ser bom, pode ser negativo".

Isso acontece porque essas 40,000 operações não são 40,000 apostas independentes em 40,000 estados de mercado distintos. São 40,000 amostras de cerca de 180 dias de comportamento do mercado; os dias têm correlação entre si, e os regimes também são correlacionados internamente. Uma carteira de reversão à média de alta frequência que lucra todos os dias durante quatro meses, na prática, fez uma aposta — a de que a reversão em horizontes curtos persiste nesse regime de liquidez — e observou essa aposta se desenrolar talvez um punhado de vezes independentes.

A troca de perspectiva que faço: conte os regimes, não os fills. Por quantas condições de mercado realmente diferentes essa estratégia passou? Uma estratégia de carry de funding que operou durante um longo período de basis positivo viu n = 1, independentemente de quantas rebalanceamentos por hora registrou.

Diagnóstico rápido: faça um bootstrap em blocos do seu P&L diário, usando blocos de 20 dias, e observe a dispersão dos Sharpes reamostrados. Se o percentil 5 ficar abaixo de zero, a quantidade de operações não importa. São cerca de nove linhas de numpy, e esse teste já me fez desistir de mais estratégias do que qualquer outra verificação isolada.

A fórmula vale para estratégias reais?

Não exatamente, e o erro favorece um resultado que você não vai gostar. O resultado 1/√T pressupõe retornos normais IID. Os retornos de estratégias reais têm autocorrelação e assimetria, geralmente negativa em qualquer estratégia que se pareça com carry, venda de volatilidade ou reversão à média. A correção de Mertens reincorpora esses momentos:

SE(s) ≈ √((1 + s²/2 − γ₃·s + (γ₄−3)·s²/4) / n)

em que γ₃ é a assimetria e γ₄, a curtose. A assimetria negativa torna positivo o termo −γ₃·s, ampliando o intervalo. A curtose excedente o amplia ainda mais. Em um P&L típico de carry em cripto, com assimetria por volta de −1.2 e curtose por volta de 9, já vi o erro padrão corrigido ficar 30–40% maior que o cálculo ingênuo. O artigo de Lo, de 2002, trata da autocorrelação e o efeito tem o mesmo sentido: a correlação serial positiva nos retornos infla o Sharpe ingênuo e reduz o erro aparente — uma combinação perigosa.

Portanto, trate 1/√T como o limite mínimo da sua incerteza. É o melhor cenário.

Qual Sharpe preciso atingir se testei 500 variantes?

Agora chegamos à parte que importa para quem roda um pipeline automatizado de pesquisa, como fazemos todos os dias na Stratmill: o agente gerador não produz um candidato, mas centenas.

O máximo esperado de M amostras de uma distribuição normal padrão é aproximadamente √(2 ln M). Multiplique isso pelo seu erro padrão e você obtém o Sharpe que a mais sortuda entre M estratégias sem valor algum vai apresentar.

Estratégias testadas√(2 ln M)Sharpe da melhor estratégia sem sinal, 5 anos (EP 0.45)Melhor sem sinal, 2 anos (EP 0.71)
102.150.961.52
1003.031.362.16
5003.531.582.50
5,0004.131.852.93

Leia a penúltima linha. Se você gerou 500 candidatos usando dois anos de dados e o vencedor apresenta Sharpe 2.4, não encontrou absolutamente nada. Esse valor está abaixo do piso de ruído. O Sharpe deflacionado de Bailey e López de Prado formaliza esse raciocínio usando a variância dos Sharpes testados no lugar da aproximação grosseira √(2 ln M). Vale a pena implementá-lo corretamente, mas a versão simplificada já basta para mudar sua conduta hoje.

Dois fatores tornam isso pior do que a tabela sugere. Primeiro, M não é o número de estratégias que você salvou, e sim o número que avaliou, incluindo cada ajuste de parâmetro, cada "deixa eu testar um lookback de 30 períodos", cada nova execução depois de corrigir um bug. Ninguém contabiliza isso com honestidade. Segundo, seus candidatos não são amostras independentes; por isso, √(2 ln M) exagera a quantidade efetiva. Ao mesmo tempo, ensaios correlacionados fazem com que um único regime de sorte favoreça todo um grupo de estratégias.

O número mais perigoso na pesquisa quantitativa é aquele que ninguém registrou: quantas vezes você olhou.

Então, o que eu faço na prática?

Cinco coisas, na ordem em que eu faria.

  1. Registre cada avaliação. Um contador que aumenta a cada execução de backtest, fica salvo e nunca é zerado. Se você não sabe quanto vale M, não sabe qual é o seu limite. É a hora de engenharia de maior retorno em toda esta lista.
  2. Sempre informe o Sharpe com seu intervalo. Nunca mostre um número isolado. Nossos relatórios de backtest exibem 1.72 ± 0.51 (2.9y, skew-adjusted) e o ± não é opcional. Isso muda a forma como toda a equipe conversa sobre os resultados.
  3. Defina o limite com base em M e T antes de olhar os resultados. Consulte o número na tabela acima e anote-o. Limites definidos depois de ver os resultados são a receita para se convencer de que um ajuste à curva funcionou.
  4. Prefira amplitude à frequência quando sua amostra for pequena. Você não pode criar mais tempo de calendário, mas pode aplicar o mesmo sinal a 40 símbolos não correlacionados. Isso aumenta de fato o n efetivo, ao contrário de aumentar a frequência das operações. Mas fique de olho nas correlações: 40 perps de cripto em uma hora de aversão ao risco são um único instrumento.
  5. Depois, faça paper trading. O tempo fora da amostra se acumula à razão de um dia por dia; não há atalhos. É por isso que essa é a única amostra que ninguém consegue sobreajustar.

Nada disso torna amostras curtas utilizáveis. Ajuda você a ser honesto sobre as conclusões que uma amostra curta pode sustentar — conclusões bem mais modestas do que a maioria dos relatórios de backtest dá a entender. Um Sharpe de 1.5 em dois anos é uma hipótese que vale a pena testar com paper trading. Não é uma descoberta.

índice de Sharpesobreajustebacktestingsignificância estatísticapesquisa quantitativa
← Todos os artigos