Aprendizaje por refuerzo offline para liquidar considerando el impacto en precios
Resumen
El documento estudia cómo un trader puede liquidar un activo arriesgado cuando las operaciones generan un impacto temporal en los precios y se desconoce el núcleo de impacto. Propone estimar el núcleo, o propagador, de forma no paramétrica a partir de datos estáticos con trayectorias de precios correlacionadas, señales de trading y metaórdenes. La precisión de la estimación se mide con una métrica que depende explícitamente del conjunto de datos disponible.
Una estrategia de ejecución codiciosa basada únicamente en el núcleo estimado puede incurrir en costes mayores de lo previsto. Los autores lo atribuyen a una correlación espuria entre la estrategia y el estimador, así como a la incertidumbre asociada a una función de costes sesgada. El método de aprendizaje por refuerzo offline que proponen usa una pérdida pesimista que tiene en cuenta la incertidumbre de la estimación y un optimizador diseñado para eliminar esa correlación. Derivan un límite asintóticamente óptimo para los costes de ejecución sin exigir un conocimiento preciso del núcleo verdadero, y presentan experimentos numéricos que respaldan el estimador y la estrategia. El fragmento no detalla los experimentos ni cuantifica el rendimiento práctico en condiciones de trading en vivo.
Ideas clave
- El método estima un núcleo de impacto transitorio en los precios a partir de datos estáticos con trayectorias correlacionadas y actividad de trading.
- Una estrategia codiciosa basada en la estimación puede ser subóptima porque la estrategia y el estimador están correlacionados de forma espuria.
- Una pérdida pesimista incorpora la incertidumbre del núcleo de impacto estimado.
- El método de aprendizaje por refuerzo offline propuesto deriva un límite asintótico de costes de ejecución sin conocer con precisión el núcleo.
- Se presentan experimentos numéricos, pero el fragmento no ofrece resultados de trading en vivo.
Etiquetas
Texto completo
# An Offline Learning Approach to Propagator Models # An Offline Learning Approach to Propagator Models We consider an offline learning problem for an agent who first estimates an unknown price impact kernel from a static dataset, and then designs strategies to liquidate a risky asset while creating transient price impact. We propose a novel approach for a nonparametric estimation of the propagator from a dataset containing correlated price trajectories, trading signals and metaorders. We quantify the accuracy of the estimated propagator using a metric which depends explicitly on the dataset. We show that a trader who tries to minimise her execution costs by using a greedy strategy purely based on the estimated propagator will encounter suboptimality due to so-called spurious correlation between the trading strategy and the estimator and due to intrinsic uncertainty resulting from a biased cost functional. By adopting an offline reinforcement learning approach, we introduce a pessimistic loss functional taking the uncertainty of the estimated propagator into account, with an optimiser which eliminates the spurious correlation, and derive an asymptotically optimal bound on the execution costs even without precise information on the true propagator. Numerical experiments are included to demonstrate the effectiveness of the proposed propagator estimator and the pessimistic trading strategy.
Se muestra íntegramente con atribución según la licencia de la fuente. Licencia: abstract CC0
Este resumen lo redactó el agente de investigación de Stratmill a partir del original; no es una copia de la fuente.