Совместный выбор пар и торговля с иерархическим обучением с подкреплением
Сводка
В статье парный трейдинг рассматривается как единая задача принятия решений, а не как последовательность этапов, где сначала выбирается пара активов, а затем совершаются сделки. Авторы утверждают, что разделение этапов может привести к потере полезной информации: при выборе пары можно не учитывать, насколько эффективно ею торговать, а торговый агент может переобучиться на выбранных активах, не обучаясь на более широком наборе активов.
В предложенном авторами методе иерархического обучения с подкреплением выбор пары поручен политике верхнего уровня, а торговые действия — политике нижнего уровня. Политики оптимизируются совместно, так что решения о выборе и исполнении влияют друг на друга. Согласно сообщению, эксперименты на реальных данных по акциям показали более высокую эффективность парного трейдинга по сравнению с существующими методами выбора и торговли. В документе нет конкретных показателей эффективности или подробного описания ограничений эксперимента, поэтому он не устанавливает, насколько метод применим к другим рынкам, классам активов или торговым издержкам.
Ключевые идеи
- Выбор пар и исполнение сделок можно обучать как взаимосвязанные части одной задачи.
- Политика верхнего уровня выбирает пару активов, а политика нижнего уровня принимает торговые решения.
- Совместное обучение позволяет учитывать информацию об эффективности торговли при выборе пар.
- В исследовании приводятся сравнения с существующими подходами на реальных данных по акциям.
- В представленном описании нет подробных показателей эффективности или свидетельств за пределами экспериментов с акциями.
Теги
Полный текст
# Select and Trade: Towards Unified Pair Trading with Hierarchical Reinforcement Learning # Select and Trade: Towards Unified Pair Trading with Hierarchical Reinforcement Learning Pair trading is one of the most effective statistical arbitrage strategies which seeks a neutral profit by hedging a pair of selected assets. Existing methods generally decompose the task into two separate steps: pair selection and trading. However, the decoupling of two closely related subtasks can block information propagation and lead to limited overall performance. For pair selection, ignoring the trading performance results in the wrong assets being selected with irrelevant price movements, while the agent trained for trading can overfit to the selected assets without any historical information of other assets. To address it, in this paper, we propose a paradigm for automatic pair trading as a unified task rather than a two-step pipeline. We design a hierarchical reinforcement learning framework to jointly learn and optimize two subtasks. A high-level policy would select two assets from all possible combinations and a low-level policy would then perform a series of trading actions. Experimental results on real-world stock data demonstrate the effectiveness of our method on pair trading compared with both existing pair selection and trading methods.
Полный текст с указанием источника опубликован на условиях его лицензии. Лицензия: abstract CC0
Это краткое изложение подготовлено исследовательским агентом Stratmill по оригиналу и не является его копией.