10 de septiembre de 2026 · investigación

Tu ratio de Sharpe superó todas las pruebas. Aun así, podría ser una coincidencia.

Tu ratio de Sharpe superó todas las pruebas. Aun así, podría ser una coincidencia.

Mil variantes de una estrategia. Un Sharpe medido de 2.0 para la ganadora. Una tasa de falsos positivos del 5%. Esas cifras parecen indicar un resultado sólido hasta que preguntas cuántos intentos hicieron falta para encontrarlo. Con suficientes pruebas, un backtest convincente puede surgir solo del ruido.

La cifra sorprendente no es el Sharpe, sino el número de ensayos. Cada ventana de indicador, umbral de entrada, elección de universo y idea descartada es otra oportunidad de seleccionar un resultado afortunado. Si tu proceso de investigación olvida esos intentos, tu cálculo de confianza también los olvida.

¿Por qué probar más estrategias hace que la ganadora parezca mejor?

Imagina que pruebas 1,000 estrategias sin ninguna ventaja real. Cada una tiene un 5% de probabilidad de parecer estadísticamente significativa en una prueba convencional. En una investigación real, esos ensayos no son perfectamente independientes, pero la idea básica se mantiene: cuantos más candidatos examines, más probable será que uno parezca excepcional por azar.

Aunque cada candidato fuera independiente, la probabilidad de que al menos uno supere ese umbral del 5% ronda el 99.4%. En la práctica, las configuraciones de parámetros cercanas suelen comportarse de forma similar, así que 1,000 variantes no equivalen a 1,000 lanzamientos independientes de una moneda. Pero el número efectivo de intentos rara vez es 1.

He visto una pequeña trampa en los notebooks: un investigador prueba períodos retrospectivos de 5 a 100, representa la superficie de Sharpe y luego informa del pico que se ve más limpio. La superficie sirve para entender la sensibilidad. Pero el pico también es el producto de una búsqueda y merece menos crédito que un umbral elegido antes del experimento.

¿Qué cuenta como ensayo de investigación?

Cuenta las decisiones influidas por los resultados observados. Un ensayo puede ser un backtest programado, pero también un cambio manual hecho tras ver la curva de capital. Si ampliaste un stop porque la configuración anterior se perdió un rally, esa revisión usó información del período de prueba.

Acción de investigación¿Suele contar como ensayo?Motivo
Probar otro umbral de señalSíEl resultado ayuda a seleccionar un candidato
Cambiar el intervalo de fechas tras observar una caídaSíLa muestra se eligió en respuesta al rendimiento
Corregir un error de datos documentadoPor lo general, noEl cambio restablece el experimento previsto
Ejecutar la misma estrategia congelada en un nuevo período de validación finalAún no cuenta como nuevo ensayo de selecciónCuenta como tal si ajustas la estrategia en función del resultado

El límite depende del criterio aplicado. Corregir una errata no es lo mismo que cambiar una característica tras observar dónde falló. Lleva un registro breve de ensayos con la hipótesis, el cambio, el período de datos y el resultado. No hace falta que sea elegante; un CSV con fechas es mejor que reconstruir de memoria tu búsqueda tres meses después.

¿Puedo corregir mi Sharpe por pruebas múltiples?

Métodos como el Deflated Sharpe Ratio estiman cuánto del rendimiento aparente podría deberse a seleccionar entre muchos candidatos, teniendo en cuenta factores como la distribución de los retornos y la dependencia entre ensayos. Son herramientas de diagnóstico útiles, pero no convierten un proceso de investigación desordenado en certeza. Sus resultados dependen de los supuestos y de que el número de ensayos sea creíble.

Para hacerse una idea aproximada, supongamos que un investigador probó 400 variantes, obtuvo un Sharpe de 1.8 y estima que sus retornos presentan una asimetría considerable y colas gruesas. Ese resultado debería superar un listón más exigente que un Sharpe de 1.8 obtenido en una única prueba prerregistrada. La corrección puede debilitar bastante la evidencia, pero no puede decirte que la ventaja sea real.

Registra la búsqueda antes de tener que defenderla: número de candidatos, rangos de parámetros, períodos de datos examinados y revisiones manuales. Si desconoces esos detalles, describe el backtest como exploratorio.

¿Qué debería ocurrir antes del paper trading?

Congela un candidato y define la siguiente evaluación antes de ejecutarla. Una secuencia útil es elegir la estrategia con datos de entrenamiento, examinarla con datos de validación y luego reservar un período final o una ventana de paper trading que no influya en el diseño. Cada etapa responde a una pregunta distinta; ajustar repetidamente la estrategia en la etapa final convierte esos datos en más datos de entrenamiento.

Comprueba también si las configuraciones cercanas cuentan la misma historia. Una zona amplia de resultados moderadamente positivos suele ser más creíble que un pico aislado y estrecho, aunque la robustez no corrige un modelo de ejecución defectuoso. Las comisiones, la financiación, el impacto y la disponibilidad de instrumentos aún deben corresponderse con lo que la estrategia podría haber encontrado en la práctica.

El paper trading aporta evidencia sobre la paridad operativa: los tiempos, la gestión de órdenes y si el pipeline de investigación en vivo se comporta como se espera. No puede borrar la selección que ya tuvo lugar. Mil backtests afortunados siguen siendo mil intentos cuando se envía la primera orden en paper trading.

Así que cuando un backtest informa de un Sharpe de 2, pide ver el historial de investigación junto a la curva de capital. ¿Cuántas ideas se probaron? ¿Qué resultados cambiaron el siguiente experimento? La respuesta podría ser la estadística más importante del informe.

sobreajuste del backtestratio de Sharpepruebas múltiplesinvestigación de estrategiaswalk-forward
← Todos los artículos