Aprendizaje de políticas de liquidación para mercados con subastas de cierre
Resumen
Este estudio analiza a un operador que vende mediante un libro de órdenes limitadas y luego ajusta el inventario restante con programas firmados en una subasta de cierre. Las dos etapas se vinculan mediante una previsión del precio de liquidación de la subasta y la retroalimentación durante esta. Los autores comparan redes Q profundas con políticas proyectadas de aprendizaje por refuerzo DDPG, TD3 y SAC en un mercado simulado, usando precios sintéticos de Heston rugoso y trayectorias históricas del precio medio.
Las políticas se eligen y evalúan mediante el déficit de ejecución penalizado por inventario, manteniendo la evaluación separada de un objetivo de entrenamiento ponderado. En las simulaciones presentadas, los métodos aprendidos logran un déficit penalizado menor que las estrategias de referencia de Avellaneda–Stoikov y TWAP. Las comparaciones sintéticas emparejadas también indican que el acceso a la subasta ayuda a los cuatro métodos de aprendizaje. Una retroalimentación más densa durante la subasta mejora el aprendizaje, mientras que el valor decisorio adicional de la previsión del precio de liquidación varía según el método de aprendizaje. Estos resultados se basan en simulaciones; la descripción no demuestra el rendimiento en trading real ni la generalización a otras condiciones de mercado.
Ideas clave
- El proceso de liquidación combina la negociación continua en un libro de órdenes limitadas con una subasta de cierre.
- Los programas de la subasta ajustan el inventario restante después de la negociación continua.
- Se comparan cuatro métodos de aprendizaje por refuerzo usando precios simulados y trayectorias históricas del precio medio.
- Las políticas aprendidas presentan un déficit menor penalizado por inventario que las referencias de Avellaneda–Stoikov y TWAP.
- El acceso a la subasta ayuda a cada método en comparaciones sintéticas emparejadas, mientras que el valor de la previsión depende del método.
Etiquetas
Texto completo
# Learning Optimal Liquidation with Closing Auctions # Learning Optimal Liquidation with Closing Auctions We study liquidation when continuous trading is followed by a closing auction. The trader first sells through a limit-order book, then submits signed auction schedules to adjust the remaining inventory. A projected clearing price signal and intermediate auction feedback connect the two phases. We compare deep Q-network (DQN) policies with projected deep deterministic policy gradient (DDPG), twin delayed deep deterministic policy gradient (TD3) and soft actor-critic (SAC) policies, using synthetic rough Heston prices and historical midprice paths within a simulated market. Policies are selected and evaluated by inventory-penalized implementation shortfall, separately from a weighted training objective. They achieve lower inventory-penalized shortfall than the stylized Avellaneda-Stoikov (AS) and time-weighted average price (TWAP) references, and matched synthetic comparisons show that auction access is useful for all four learners. We furthermore find that dense auction credit improves learning; the clearing forecast is informative, but its incremental decision value is learner-dependent.
Se muestra íntegramente con atribución según la licencia de la fuente. Licencia: abstract CC0
Este resumen lo redactó el agente de investigación de Stratmill a partir del original; no es una copia de la fuente.