Глубокое Q-обучение для торговли портфелем активов
Сводка
В исследовании торговля портфелем формулируется как марковский процесс принятия решений; агента обучают с помощью глубокого Q-обучения выбирать распределение средств между несколькими активами. Пространство действий дискретно и комбинаторно: для каждого актива агент выбирает направление торговли с заранее заданным размером позиции. Чтобы учесть действия, нарушающие ограничения, метод заменяет недопустимое предложение ближайшей допустимой альтернативой. Также описана конструкция агента и Q-сети, предназначенная для работы с пространством действий по нескольким активам и моделирования допустимых действий в каждом состоянии.
Подход оценивается с помощью бэктестов на двух репрезентативных портфелях; сообщается, что результаты превзошли базовые стратегии. В документе не названы портфели и базовые стратегии, период оценки или предположения о транзакционных издержках, поэтому по одному описанию нельзя судить о широте этого сравнения и его значимости для торговли на реальном счёте.
Ключевые идеи
- Решение о портфеле моделируется как марковский процесс принятия решений с обучением методом глубокого Q-обучения.
- Для каждого актива агент выбирает дискретное направление торговли и заранее заданный размер позиции.
- Отдельный шаг преобразует недопустимые предложенные действия в близкие к ним допустимые действия.
- По результатам бэктестов на двух портфелях стратегии превзошли базовые, но детали оценки не приводятся.
Теги
Полный текст
# An intelligent financial portfolio trading strategy using deep Q-learning # An intelligent financial portfolio trading strategy using deep Q-learning Portfolio traders strive to identify dynamic portfolio allocation schemes so that their total budgets are efficiently allocated through the investment horizon. This study proposes a novel portfolio trading strategy in which an intelligent agent is trained to identify an optimal trading action by using deep Q-learning. We formulate a Markov decision process model for the portfolio trading process, and the model adopts a discrete combinatorial action space, determining the trading direction at prespecified trading size for each asset, to ensure practical applicability. Our novel portfolio trading strategy takes advantage of three features to outperform in real-world trading. First, a mapping function is devised to handle and transform an initially found but infeasible action into a feasible action closest to the originally proposed ideal action. Second, by overcoming the dimensionality problem, this study establishes models of agent and Q-network for deriving a multi-asset trading strategy in the predefined action space. Last, this study introduces a technique that has the advantage of deriving a well-fitted multi-asset trading strategy by designing an agent to simulate all feasible actions in each state. To validate our approach, we conduct backtests for two representative portfolios and demonstrate superior results over the benchmark strategies.
Полный текст с указанием источника опубликован на условиях его лицензии. Лицензия: abstract CC0
Это краткое изложение подготовлено исследовательским агентом Stratmill по оригиналу и не является его копией.