30 de agosto de 2026 · estadísticas

¿Cuántas operaciones necesita un backtest para que el Sharpe signifique algo?

¿Cuántas operaciones necesita un backtest para que el Sharpe signifique algo?

Esta es la pregunta que más me hacen, de una forma u otra, quienes acaban de terminar su primera estrategia: ¿cuántas operaciones necesito para que el resultado sea real? Normalmente viene acompañada de una cifra. «Tengo 1,200 operaciones; es suficiente, ¿no?». Y la respuesta honesta molesta a todo el mundo, porque no tiene nada que ver con el número de operaciones.

Aquí está todo en una sola línea; después dedicaré el resto del artículo a explicar por qué duele.

1/√Terror estándar de un Sharpe anualizado, T en años
±0.88intervalo del 95% alrededor de cualquier Sharpe de 5 años
1.4Sharpe que alcanza la más afortunada de 100 estrategias de puro ruido durante esos mismos 5 años

¿Cuál es el error estándar de un ratio de Sharpe?

Para un Sharpe calculado sobre n rendimientos periódicos, suponiendo que son independientes y aproximadamente normales, el error de muestreo es:

SE(s) ≈ √((1 + s²/2) / n)

donde s es el Sharpe medido con esa misma frecuencia. Anualiza ambos lados y se obtiene una expresión sencilla. Con k observaciones por año y T años, el Sharpe anualizado S tiene:

SE(S) ≈ √((1 + S²/(2k)) / T)

Fíjate en ese 2k del denominador. Para los rendimientos diarios k = 252, así que incluso un Sharpe de 2 aporta 4/504 ≈ 0.008 al numerador. Todo el término se reduce a 1. El error estándar de un Sharpe anualizado es aproximadamente 1/√T, donde T es el número de años naturales de datos. Apenas depende del propio Sharpe, no depende de la frecuencia de muestreo y desde luego no depende del número de operaciones que hayas realizado.

Así que:

Años de datosEE(Sharpe)IC del 95% si mediste 1.5
11.00−0.46 a 3.46
20.710.11 a 2.89
30.580.37 a 2.63
50.450.62 a 2.38
100.320.88 a 2.12

Un backtest con un Sharpe de 1.5 sobre dos años de historial no puede distinguir estadísticamente, con un nivel de confianza del 95%, si el resultado es mejor que lanzar una moneda. Esa es la situación de partida en la mayoría de las investigaciones sobre criptomonedas, porque los datos limpios, corregidos por sesgo de supervivencia y con comisiones precisas suelen empezar hacia 2022, y la mitad de los símbolos interesantes ni siquiera existían antes de 2023.

Pero tengo 40,000 operaciones. ¿Eso no lo soluciona?

No, y este es el malentendido que más quiero desterrar.

El número de operaciones y la longitud de la muestra son magnitudes distintas, y en la fórmula solo aparece una. Si tu estrategia opera 40,000 veces en seis meses, tienes T = 0.5 y EE ≈ 1.41. Tu intervalo del 95% para un Sharpe medido de 2.0 va de −0.8 a 4.8. Cuarenta mil operaciones, y la conclusión honesta es «puede ser buena o puede dar pérdidas».

La razón es que esas 40,000 operaciones no son 40,000 apuestas independientes en 40,000 estados de mercado distintos. Son 40,000 muestras de unos 180 días de comportamiento del mercado; los días están correlacionados entre sí y los regímenes también presentan correlación interna. Un libro de reversión a la media de alta frecuencia que gana dinero todos los días durante cuatro meses en realidad ha hecho una sola apuesta: que la reversión a corto plazo se mantiene en este régimen de liquidez. Y quizá ha observado cómo se resuelve esa apuesta en un puñado de ocasiones independientes.

La sustitución mental que uso es: cuenta los regímenes, no las ejecuciones. ¿Cuántas condiciones de mercado realmente distintas ha superado esta estrategia? Una estrategia de carry de funding que ha operado durante una sola etapa larga con basis positivo solo ha visto n = 1, independientemente de cuántos rebalanceos horarios haya registrado.

Diagnóstico rápido: aplica un bootstrap por bloques a tu P&L diario con bloques de 20 días y observa la dispersión de los Sharpes remuestreados. Si el percentil 5 queda por debajo de cero, el número de operaciones es irrelevante. Se hace en unas nueve líneas de numpy y me ha disuadido de más estrategias que cualquier otra comprobación.

¿La fórmula se cumple para estrategias reales?

No exactamente, y se equivoca en la dirección que menos te gustará. El resultado 1/√T supone rendimientos IID normales. Los rendimientos de las estrategias reales presentan autocorrelación y asimetría, que suele ser negativa en cualquier estrategia parecida al carry, a posiciones cortas en volatilidad o a la reversión a la media. La corrección de Mertens incorpora esos momentos:

SE(s) ≈ √((1 + s²/2 − γ₃·s + (γ₄−3)·s²/4) / n)

donde γ₃ es la asimetría y γ₄ la curtosis. Una asimetría negativa hace que el término −γ₃·s sea positivo y amplía el intervalo. El exceso de curtosis lo amplía aún más. En un P&L típico de carry en criptomonedas, con una asimetría cercana a −1.2 y una curtosis cercana a 9, he visto que el error estándar corregido resulta un 30–40% mayor que el cálculo ingenuo. El artículo de Lo de 2002 aborda la autocorrelación y el efecto tiene el mismo signo: la correlación serial positiva de los rendimientos infla el Sharpe ingenuo y reduce el error aparente, una combinación desagradable.

Así que considera 1/√T como un límite inferior de tu incertidumbre. Es el mejor de los casos.

¿Qué Sharpe necesito si probé 500 variantes?

Ahora llegamos a lo que importa para cualquiera que ejecute un pipeline automatizado de investigación, que es nuestro día a día en Stratmill: el agente generador no produce un solo candidato, sino cientos.

El máximo esperado de M extracciones de una normal estándar es aproximadamente √(2 ln M). Multiplícalo por tu error estándar y obtendrás el Sharpe que mostraría la más afortunada de M estrategias que en realidad no valen nada.

Estrategias probadas√(2 ln M)Sharpe de la mejor estrategia de puro ruido, 5 años (EE 0.45)Mejor estrategia de puro ruido, 2 años (EE 0.71)
102.150.961.52
1003.031.362.16
5003.531.582.50
5,0004.131.852.93

Mira la penúltima fila. Si generaste 500 candidatos con dos años de datos y el ganador muestra un Sharpe de 2.4, no has encontrado absolutamente nada. Está por debajo del nivel de ruido. El Sharpe deflactado de Bailey y López de Prado formaliza esto usando la varianza de los Sharpes de tus pruebas en lugar de la aproximación rudimentaria √(2 ln M). Merece la pena implementarlo bien, pero la versión aproximada basta para cambiar hoy mismo tu forma de trabajar.

Hay dos cosas que lo empeoran respecto a lo que sugiere la tabla. Primero, M no es el número de estrategias que guardaste, sino el número que evaluaste, incluidos todos los ajustes de parámetros, cada «voy a probar un lookback de 30 períodos» y cada nueva ejecución después de corregir un error. Nadie lleva la cuenta con honestidad. Segundo, tus candidatos no son extracciones independientes, así que √(2 ln M) exagera la amplitud efectiva; aunque los ensayos correlacionados también implican que un régimen afortunado eleva a todo un grupo de candidatos a la vez.

La cifra más peligrosa en la investigación cuantitativa es la que nadie registró: cuántas veces miraste.

Entonces, ¿qué hago en la práctica?

Cinco cosas, en el orden en que las haría.

  1. Registra cada evaluación. Un contador que aumenta con cada ejecución del backtest, queda guardado y nunca se reinicia. Si no puedes decir cuánto vale M, tampoco puedes decir cuál es tu umbral. Es la hora de ingeniería más valiosa de toda la lista.
  2. Informa siempre del Sharpe con su intervalo. Nunca presentes una cifra aislada. Nuestros informes de backtest muestran 1.72 ± 0.51 (2.9y, skew-adjusted) y el ± es obligatorio. Cambia la forma en que todo el equipo habla de los resultados.
  3. Fija el umbral según M y T antes de mirar los resultados. Saca la cifra de la tabla de arriba y anótala. Los umbrales establecidos a posteriori son la forma en que todo el mundo acaba convenciéndose de que un ajuste a la curva funciona.
  4. Cuando escasean las muestras, prioriza la amplitud sobre la frecuencia. No puedes fabricar más tiempo natural, pero sí puedes ejecutar la misma señal en 40 símbolos no correlacionados. Eso sí aumenta el n efectivo, cosa que no consigues aumentando la frecuencia de las operaciones. Pero vigila las correlaciones: 40 perpetuos de criptomonedas durante una hora de aversión al riesgo equivalen a un solo instrumento.
  5. Después, haz paper trading. El tiempo fuera de muestra se acumula a razón de un día por día y no hay atajos. Precisamente por eso es la única muestra que nadie puede sobreajustar.

Nada de esto hace que las muestras cortas sirvan. Te obliga a ser honesto sobre lo que pueden respaldar, una afirmación mucho más modesta que lo que dan a entender la mayoría de los informes de backtest. Un Sharpe de 1.5 en dos años es una hipótesis que vale la pena probar con paper trading. No es un hallazgo.

ratio de Sharpesobreajustebacktestingsignificación estadísticainvestigación cuantitativa
← Todos los artículos