Обучение с подкреплением для парной торговли с учётом риска
Сводка
В документе описан CREDIT — подход к парной торговле с обучением с подкреплением, использующий двунаправленный блок рекуррентной сети с управляемыми воротами (GRU) и временное внимание. Архитектура предназначена для выявления связей во времени в движениях цен двух активов, включая закономерности, которые могут быть упущены при независимом рассмотрении состояний рынка. Подход также использует функцию вознаграждения, учитывающую торговую прибыль и риск, стремясь снижать привлекательность сделок с высоким потенциальным выигрышем и убытком.
Авторы представляют этот метод как ответ на частую торговлю, транзакционные издержки и склонность к риску в более ранних подходах с обучением с подкреплением. По их сообщению, CREDIT превосходит существующие методы обучения с подкреплением и приносит значительную прибыль в экспериментах на данных по акциям США за пять лет. Во фрагменте нет сведений о бенчмарках, предположениях об издержках, оценке риска или численных результатах, поэтому масштаб и устойчивость заявленного преимущества оценить невозможно. Эффективность на других рынках или периодах здесь не подтверждена.
Ключевые идеи
- CREDIT применяет рекуррентное обучение и временное внимание к истории цен двух активов для парной торговли.
- Функция вознаграждения учитывает и прибыль, и торговый риск.
- Метод нацелен на выявление долгосрочных закономерностей цен и сокращение чрезмерно частой торговли.
- По сообщению авторов, в экспериментах на данных по акциям США за пять лет метод превзошёл другие подходы с обучением с подкреплением.
- Во фрагменте недостаточно подробностей, чтобы оценить устойчивость результатов или реальные торговые издержки.
Теги
Полный текст
# Mastering Pair Trading with Risk-Aware Recurrent Reinforcement Learning # Mastering Pair Trading with Risk-Aware Recurrent Reinforcement Learning Although pair trading is the simplest hedging strategy for an investor to eliminate market risk, it is still a great challenge for reinforcement learning (RL) methods to perform pair trading as human expertise. It requires RL methods to make thousands of correct actions that nevertheless have no obvious relations to the overall trading profit, and to reason over infinite states of the time-varying market most of which have never appeared in history. However, existing RL methods ignore the temporal connections between asset price movements and the risk of the performed trading. These lead to frequent tradings with high transaction costs and potential losses, which barely reach the human expertise level of trading. Therefore, we introduce CREDIT, a risk-aware agent capable of learning to exploit long-term trading opportunities in pair trading similar to a human expert. CREDIT is the first to apply bidirectional GRU along with the temporal attention mechanism to fully consider the temporal correlations embedded in the states, which allows CREDIT to capture long-term patterns of the price movements of two assets to earn higher profit. We also design the risk-aware reward inspired by the economic theory, that models both the profit and risk of the tradings during the trading period. It helps our agent to master pair trading with a robust trading preference that avoids risky trading with possible high returns and losses. Experiments show that it outperforms existing reinforcement learning methods in pair trading and achieves a significant profit over five years of U.S. stock data.
Полный текст с указанием источника опубликован на условиях его лицензии. Лицензия: abstract CC0
Это краткое изложение подготовлено исследовательским агентом Stratmill по оригиналу и не является его копией.