Selección y trading conjunto de pares con aprendizaje jerárquico por refuerzo
Resumen
Este artículo aborda el trading de pares como un problema de decisión conjunto, en vez de como un proceso que primero selecciona un par de activos y después opera con él. Los autores sostienen que separar estas etapas puede hacer perder información útil: la selección puede ignorar si es posible operar eficazmente con un par, mientras que un agente de trading puede sobreajustarse a los activos elegidos sin aprender del universo más amplio de activos.
Su método de aprendizaje jerárquico por refuerzo asigna la elección del par a una política de alto nivel y las decisiones de trading a una política de bajo nivel. Ambas políticas se optimizan conjuntamente, lo que permite que las decisiones de selección y ejecución se informen mutuamente. Se presentan experimentos con datos bursátiles reales que muestran una mayor eficacia del trading de pares frente a métodos existentes de selección y trading. El documento no aporta cifras concretas de rendimiento ni limitaciones experimentales detalladas, por lo que no demuestra cómo se generaliza el enfoque a otros mercados, clases de activos o costes de trading.
Ideas clave
- La selección de pares y la ejecución de operaciones pueden aprenderse como partes conectadas de una misma tarea.
- Una política de alto nivel elige el par de activos y una política de bajo nivel toma las decisiones de trading.
- El aprendizaje conjunto puede trasladar información sobre el rendimiento del trading a la selección de pares.
- El estudio presenta comparaciones con enfoques existentes usando datos bursátiles reales.
- La descripción no aporta cifras detalladas de rendimiento ni evidencia más allá de los experimentos con acciones.
Etiquetas
Texto completo
# Select and Trade: Towards Unified Pair Trading with Hierarchical Reinforcement Learning # Select and Trade: Towards Unified Pair Trading with Hierarchical Reinforcement Learning Pair trading is one of the most effective statistical arbitrage strategies which seeks a neutral profit by hedging a pair of selected assets. Existing methods generally decompose the task into two separate steps: pair selection and trading. However, the decoupling of two closely related subtasks can block information propagation and lead to limited overall performance. For pair selection, ignoring the trading performance results in the wrong assets being selected with irrelevant price movements, while the agent trained for trading can overfit to the selected assets without any historical information of other assets. To address it, in this paper, we propose a paradigm for automatic pair trading as a unified task rather than a two-step pipeline. We design a hierarchical reinforcement learning framework to jointly learn and optimize two subtasks. A high-level policy would select two assets from all possible combinations and a low-level policy would then perform a series of trading actions. Experimental results on real-world stock data demonstrate the effectiveness of our method on pair trading compared with both existing pair selection and trading methods.
Se muestra íntegramente con atribución según la licencia de la fuente. Licencia: abstract CC0
Este resumen lo redactó el agente de investigación de Stratmill a partir del original; no es una copia de la fuente.