Сравнение DQN и PPO для обучения с подкреплением в торговле на форексе
Сводка
В исследовании глубокое обучение с подкреплением применяется к торговле на валютном рынке: выбор сделки рассматривается как последовательность решений, а не как задача прямого прогнозирования цены. Авторы адаптируют политику статистического арбитража Sure-Fire так, чтобы она включала три возможных действия, и преобразуют непрерывную историю цен в изображения поля углов Грамма. Deep Q Learning сравнивается с проксимальной оптимизацией политик на данных EUR/USD, GBP/USD и AUD/USD с четырёхчасовым интервалом.
Для обучения используются данные с 1 августа по 30 ноября 2018, а тестовый период — декабрь 2018. Авторы сообщают о благоприятных инвестиционных результатах моделей, способных представлять сложное случайное поведение рынка и состояния, адекватно описывающие торговую среду. В предоставленном описании нет показателей доходности, метрик риска, предположений о комиссиях или подробных настроек модели, поэтому здесь нельзя оценить убедительность результатов и возможность их сравнения. Представленные данные — это проверка осуществимости на трёх валютных парах с коротким историческим разделением; они не доказывают, что любой из алгоритмов будет надёжно работать в другие периоды или при исполнении сделок на реальном рынке.
Ключевые идеи
- Подход рассматривает торговлю на форексе как задачу последовательного принятия решений с помощью обучения с подкреплением.
- В адаптированной политике статистического арбитража определены три торговых действия.
- Окна цен кодируются как изображения поля углов Грамма и подаются на вход модели.
- Deep Q Learning и проксимальная оптимизация политик сравниваются на трёх валютных парах.
- В краткой исторической оценке сообщается о благоприятных результатах, но подробные метрики и предположения о торговых издержках не приводятся.
Теги
Полный текст
# Deep Reinforcement Learning for Foreign Exchange Trading # Deep Reinforcement Learning for Foreign Exchange Trading Reinforcement learning can interact with the environment and is suitable for applications in decision control systems. Therefore, we used the reinforcement learning method to establish a foreign exchange transaction, avoiding the long-standing problem of unstable trends in deep learning predictions. In the system design, we optimized the Sure-Fire statistical arbitrage policy, set three different actions, encoded the continuous price over a period of time into a heat-map view of the Gramian Angular Field (GAF) and compared the Deep Q Learning (DQN) and Proximal Policy Optimization (PPO) algorithms. To test feasibility, we analyzed three currency pairs, namely EUR/USD, GBP/USD, and AUD/USD. We trained the data in units of four hours from 1 August 2018 to 30 November 2018 and tested model performance using data between 1 December 2018 and 31 December 2018. The test results of the various models indicated that favorable investment performance was achieved as long as the model was able to handle complex and random processes and the state was able to describe the environment, validating the feasibility of reinforcement learning in the development of trading strategies.
Полный текст с указанием источника опубликован на условиях его лицензии. Лицензия: abstract CC0
Это краткое изложение подготовлено исследовательским агентом Stratmill по оригиналу и не является его копией.