9 de octubre de 2026 · investigación

Un mejor backtest puede empeorar la investigación de estrategias

Un mejor backtest puede empeorar la investigación de estrategias

Un backtest sirve más para descartar una estrategia que para elegir una. En cuanto usas el rendimiento histórico para escoger entre muchas variantes, el backtest pasa a formar parte del experimento y la aparente ganadora empieza a tener un coste oculto: el sesgo de selección.

Suena al revés. Hacemos backtesting porque queremos saber qué estrategia funciona. Pero cada decisión guiada por esos mismos datos consume parte de su evidencia. Si cambias el periodo retrospectivo, el umbral, el universo, el día de rebalanceo o la regla de stop después de ver los resultados, le has planteado otra pregunta a los datos. Tarde o temprano habrán oído suficientes preguntas como para darte por casualidad una respuesta convincente.

¿Por qué probar más estrategias hace que el mejor resultado sea menos fiable?

Imagina que pruebas 100 estrategias sin ninguna ventaja real. Aun así, sus rendimientos serán distintos. Si las estimaciones de rendimiento son más o menos independientes y el ruido sigue una distribución normal, el mejor Sharpe entre ellas será positivo, aunque el Sharpe real de todas sea cero.

Una aproximación general al máximo esperado de 100 observaciones independientes de una normal estándar es 2.5 desviaciones estándar por encima de la media. Tómalo como ejemplo ilustrativo, no como una corrección que puedas copiar en un informe: las variantes reales de estrategias están correlacionadas, las estimaciones de Sharpe tienen su propio error de muestreo y los rendimientos rara vez se comportan como observaciones normales ideales. Con todas esas salvedades, la conclusión práctica se mantiene: cuantos más candidatos examines, más probable es que la puntuación más alta refleje ruido favorable.

Y un «candidato» no es solo un backtest guardado. También cuenta cada decisión que tomas después de ver un resultado: ampliar el universo porque el gráfico parece irregular, descartar un año que perjudica o cambiar el supuesto de comisiones hasta que la curva se recupere. Esas decisiones cuentan aunque nadie les haya asignado un número de versión.

Lleva un registro de investigación antes de probar la siguiente variante

Registra toda la búsqueda, incluidas las ideas descartadas y el motivo de cada cambio. Así tendrás una descripción más honesta de cuánto se seleccionó el resultado y será más difícil recordar solo las pruebas atractivas.

DatoEjemploPor qué importa
HipótesisLa reversión a corto plazo es más fuerte después de movimientos inusualmente grandes en perpetuos de BTCSepara la idea de los parámetros que finalmente se le asignen
Variante y fecha y horaSeñal de 48 horas, 2026-10-09, ejecución 014Cuenta la búsqueda y vincula los resultados con el código y los datos
Regla de selecciónElegir según el Sharpe neto; mínimo de 100 operacionesDeja claro qué significaba «mejor» antes de comparar
Variantes descartadasVentanas de 12, 24 y 72 horas; todas conservadasEvita que la ganadora visible borre a sus competidoras

Un registro no deshace la búsqueda. La hace transparente, que es el primer paso para juzgar cuánta confianza merece la ganadora.

Reserva datos que el proceso de investigación no pueda revisar una y otra vez

Divide los datos por periodo y protege el tramo final. Desarrolla la estrategia en un periodo, toma decisiones con un periodo de validación y evalúa la estrategia congelada una sola vez con un conjunto de datos posterior reservado. Por ejemplo, podrías usar 2018–2022 para el desarrollo, 2023 para la validación y reservar 2024–2025. Son solo fechas orientativas: la división debe depender del mercado, el horizonte de la estrategia y la cobertura de los datos.

Define por escrito qué significa «congelada»: señal, universo, tamaño de las posiciones, supuestos de ejecución y cualquier regla para los datos faltantes. Si el conjunto reservado da un resultado decepcionante y ajustas la estrategia en función de él, ese periodo pasa a ser parte de los datos de validación. La siguiente evaluación honesta necesitará evidencia nueva.

Aquí también pesan las muestras pequeñas. Una estrategia que opera 18 veces en el periodo reservado no permite emitir un veredicto preciso. Informa el número de operaciones y la incertidumbre junto con las estadísticas de rendimiento: una sola media puede hacer que una muestra escasa parezca concluyente.

100variantes nulas ilustrativas examinadas
2.5σpuntuación máxima esperada aproximada, bajo supuestos simplificadores
1evaluación del conjunto reservado después de congelar la estrategia

¿Significa esto que los backtests no sirven para elegir estrategias?

No. Quienes los critican tienen razón en que reservar datos de forma estricta puede ser un desperdicio: los mercados cambian, el historial es corto y un periodo intacto puede representar solo un régimen inusual. Un proceso walk-forward bien diseñado puede mostrar cómo se comporta una estrategia a medida que avanza el historial disponible. Aun así, eso no vuelve gratuito el ajuste repetido. Si examinas cada tramo y modificas la estrategia, esos tramos influyeron en la investigación.

Usa backtests para detectar modos de fallo, comparar un número reducido de ideas basadas en un mecanismo de mercado y comprobar si los resultados resisten comisiones, funding, impacto y cambios de parámetros plausibles. Lleva un registro. Reserva un conjunto de datos final. Después, pasa una versión prometedora y congelada a trading en simulado, donde pueden salir a la luz discrepancias operativas.

La respuesta más contundente de un backtest suele ser: «Esta idea falla en condiciones que ya podemos observar». Cuando diga «Esta es la mejor estrategia», pregúntate cuántas otras respuestas le pediste.

investigación de estrategiasbacktestingsobreajustewalk-forwardtrading en simulado
← Todos los artículos