Cuatro cifras pueden contar una historia incómoda: un Sharpe walk-forward de 1.4, 312 operaciones históricas, 46 operaciones en paper trading y una brecha de 18 puntos básicos entre los precios de ejecución del paper trading y el backtest. El Sharpe acapara los titulares. Los 18 puntos básicos podrían explicar por qué la estrategia parece distinta antes de que haya suficiente historial de paper trading para evaluar su rendimiento.
Las pruebas walk-forward preguntan si un proceso de investigación podría haber seleccionado una estrategia usando datos pasados y haberla evaluado con datos posteriores. El paper trading pregunta si un sistema en ejecución, con sus datos, relojes, lógica de órdenes y ejecuciones actuales, se comporta como el proceso probado. Son preguntas relacionadas, pero la primera no responde automáticamente la segunda.
¿Qué demuestra realmente la validación walk-forward?
Supongamos que entrenas o seleccionas una estrategia con 6 meses de datos y luego la evalúas durante el mes siguiente. Avanza esa ventana y repite el proceso. Si cada mes de prueba queda fuera del proceso de selección correspondiente, el ejercicio aporta evidencia sobre el rendimiento en una serie de condiciones históricas.
No demuestra que el paper trading vaya a reproducir las mismas decisiones o ejecuciones. La prueba histórica puede usar velas completas, un calendario de comisiones fijo y un modelo simplificado de órdenes de mercado. El proceso de paper trading en ejecución consume datos a medida que llegan y envía órdenes simuladas por otra vía. Uno puede ser sólido mientras el otro presenta una discrepancia.
Por eso, que haya 46 operaciones en paper trading frente a 312 en la muestra walk-forward no constituye por sí solo un veredicto. Comprueba la ventana de comparación, la frecuencia de las señales, las posiciones abiertas en los límites y si ambos recuentos usan la misma definición de operación. Una ejecución de 6 semanas en paper trading no puede igualar el número de operaciones de un año de pruebas móviles.
¿Por qué revela tanto la brecha en las ejecuciones?
Conviene desglosar una brecha media de 18 puntos básicos antes de interpretar la curva de capital del paper trading. ¿Se mide desde la ejecución supuesta en el backtest hasta la ejecución del simulador de paper trading, o desde el punto medio en el momento de la decisión hasta la ejecución en paper trading? Son mediciones distintas. Registra por separado el precio de decisión, el precio de llegada de la orden, la ejecución simulada, las comisiones y cualquier financiación.
| Diferencia observada | Primera comprobación | Por qué importa |
|---|---|---|
| Menos operaciones en paper trading | Marcas de tiempo de las señales y reglas de elegibilidad | Una entrada ausente o retrasada puede impedir decisiones |
| Mismas operaciones, peores ejecuciones | Tipo de orden, diferencial, impacto y nivel de comisiones | El backtest podría suponer una vía de ejecución más barata |
| Tamaños de posición distintos | Efectivo, multiplicador del contrato y redondeo | Las pequeñas discrepancias de unidades se acumulan entre órdenes |
| Deriva después de un reinicio | Posición recuperada y órdenes pendientes | El proceso de paper trading podría reanudarse desde otro estado |
Por ejemplo, un backtest que compra en la apertura de la siguiente vela puede parecerse a una orden de mercado en paper trading para un instrumento líquido. Pero si la orden en paper trading llega después de un movimiento brusco, la brecha incluye tanto el momento y el movimiento del mercado como el coste de ejecución. Llamar «deslizamiento» a los 18 puntos básicos oculta la causa.
¿Cómo comparo el paper trading con una prueba walk-forward?
Empieza por las decisiones, sigue con las órdenes y termina con las ejecuciones. Para cada decisión del paper trading, vuelve a ejecutar la misma versión de la estrategia con el mismo historial de datos y compara qué información tenía en ese instante. Un registro útil de paridad incluye:
- La versión de la estrategia y sus parámetros, incluida la ventana de selección que los produjo.
- Los valores de entrada, con la hora del evento y la hora en que estuvieron disponibles.
- La señal, la posición objetivo, la posición actual y la orden propuesta.
- Las restricciones de las órdenes, las comisiones, la financiación y los detalles de la ejecución simulada.
- El efectivo y el estado de la posición antes y después de la ejecución.
Si las señales difieren, revisa los tiempos de los datos y las versiones del código. Si las señales coinciden pero las órdenes difieren, revisa el tamaño, las reglas del mercado y el estado de la cartera. Si las órdenes coinciden pero las ejecuciones difieren, revisa las hipótesis de ejecución. Mantén esas capas separadas; de lo contrario, una sola cifra de rendimiento te llevará a buscar en el lugar equivocado.
¿Cuándo indica la deriva que la estrategia está rota?
Cuando la cadena de procesamiento coincida, compara los resultados durante un período común significativo y analiza el comportamiento previsto de la estrategia. Un puñado de operaciones en paper trading puede revelar enseguida una marca de tiempo defectuosa o un problema en la ruta de las órdenes. No permite saber de forma fiable si cambió el rendimiento medio de la estrategia. Para eso hacen falta suficientes observaciones, y la cantidad necesaria depende de cuánto ruido y agrupamiento haya en sus rendimientos.
Las condiciones del mercado también pueden cambiar. Un diferencial que se amplía o una financiación que se vuelve persistentemente desfavorable pueden perjudicar a la estrategia aunque todas las decisiones coincidan. Eso sí es un cambio en las condiciones de trading, no un fallo de validación. Lleva un registro de los costes y las exposiciones junto con los rendimientos para que la diferencia quede clara.
La validación walk-forward aporta evidencia sobre un proceso de selección en períodos históricos. El paper trading aporta evidencia sobre el sistema en ejecución bajo las condiciones observadas. Cuando sus resultados divergen, busca primero el punto más temprano en el que dejan de coincidir sus registros. A menudo, la cifra sorprendente no es el Sharpe, sino la pequeña diferencia de ejecución o de datos que hace que los 2 experimentos respondan preguntas distintas.
← Todos los artículos


