Apprentissage de politiques de liquidation pour les marchés avec enchères de clôture | Stratmill
Résumé
Cette étude porte sur un trader qui vend dans un carnet d’ordres à cours limité, puis ajuste l’inventaire restant au moyen de calendriers d’exécution indiquant le sens des ordres dans une enchère de clôture. Les deux étapes sont reliées par une prévision du prix d’équilibre de l’enchère et par les retours d’information pendant celle-ci. Les auteurs comparent des réseaux Q profonds à des politiques d’apprentissage par renforcement projeté DDPG, TD3 et SAC dans un marché simulé, à l’aide de prix de Heston rugueux synthétiques et de trajectoires historiques du prix médian.
Les politiques sont choisies et évaluées selon le déficit d’exécution pénalisé par l’inventaire, l’évaluation étant séparée de l’objectif d’entraînement pondéré. Dans les simulations rapportées, les approches apprises affichent un déficit pénalisé inférieur à celui des stratégies de référence Avellaneda–Stoikov et TWAP. Des comparaisons synthétiques appariées indiquent également que l’accès à l’enchère aide les quatre méthodes d’apprentissage. Des retours d’information plus fréquents pendant l’enchère améliorent l’apprentissage, tandis que la valeur décisionnelle supplémentaire de la prévision du prix d’équilibre varie selon l’algorithme d’apprentissage. Ces résultats reposent sur des simulations ; la description n’établit ni une performance en trading réel ni une généralisation à d’autres conditions de marché.
Idées clés
- Le processus de liquidation combine le trading continu dans un carnet d’ordres à cours limité et une enchère de clôture.
- Les calendriers de l’enchère ajustent l’inventaire restant après le trading continu.
- Quatre approches d’apprentissage par renforcement sont comparées à l’aide de prix simulés et de trajectoires historiques du prix médian.
- Les politiques apprises affichent un déficit pénalisé par l’inventaire inférieur aux références Avellaneda–Stoikov et TWAP.
- L’accès à l’enchère aide chaque algorithme d’apprentissage dans les comparaisons synthétiques appariées, tandis que la valeur des prévisions dépend de l’algorithme.
Étiquettes
Texte intégral
# Learning Optimal Liquidation with Closing Auctions # Learning Optimal Liquidation with Closing Auctions We study liquidation when continuous trading is followed by a closing auction. The trader first sells through a limit-order book, then submits signed auction schedules to adjust the remaining inventory. A projected clearing price signal and intermediate auction feedback connect the two phases. We compare deep Q-network (DQN) policies with projected deep deterministic policy gradient (DDPG), twin delayed deep deterministic policy gradient (TD3) and soft actor-critic (SAC) policies, using synthetic rough Heston prices and historical midprice paths within a simulated market. Policies are selected and evaluated by inventory-penalized implementation shortfall, separately from a weighted training objective. They achieve lower inventory-penalized shortfall than the stylized Avellaneda-Stoikov (AS) and time-weighted average price (TWAP) references, and matched synthetic comparisons show that auction access is useful for all four learners. We furthermore find that dense auction credit improves learning; the clearing forecast is informative, but its incremental decision value is learner-dependent.
Reproduit dans son intégralité avec attribution, conformément à la licence de la source. Licence: abstract CC0
Ce résumé a été rédigé par l’agent de recherche de Stratmill à partir de la source originale ; il n’en est pas une copie.