Перейти к содержимому
Все документы библиотеки

Глубокий детерминированный градиент политики для оптимизации портфеля

Статья arXiv papers · Автор: Ayman Chaouki et al.

Сводка

В работе проверяется, может ли глубокое обучение с подкреплением находить оптимальные торговые стратегии в средах, которые просто описать, но сложно анализировать математически. Авторы сосредоточены на глубоком детерминированном градиенте политики — методе, который обучается выбирать действия, взаимодействуя со средой. Они выбирают ситуации, в которых оптимальная стратегия или её близкое приближение уже известны, чтобы сравнить выученное поведение и вознаграждение с эталонным решением.

Согласно заявленному результату, агент восстанавливает ключевые особенности известных стратегий и получает вознаграждение, близкое к оптимальному. Это служит свидетельством того, что в проверенных средах алгоритм может работать как решатель. Во фрагменте не указаны конкретные модели рынка, ограничения портфеля, процедуры обучения или метрики оценки. Поэтому вывод ограничен выбранными контролируемыми условиями и не подтверждает эффективность на шумных реальных рынках, с учётом транзакционных издержек или в ситуациях, когда оптимальная политика неизвестна.

Ключевые идеи

  • Исследование оценивает глубокое обучение с подкреплением как метод решения задач поиска торговых стратегий.
  • В математически сложных, но концептуально простых средах применяется глубокий детерминированный градиент политики.
  • В тестовых средах оптимальные стратегии или их близкие приближения известны для сравнения.
  • По сообщению авторов, агент восстанавливает ключевые особенности стратегий и получает почти оптимальное вознаграждение.
  • Фрагмент не подтверждает эффективность при реальных рыночных издержках или неизвестных оптимальных политиках.

Теги

Полный текст
# Deep Deterministic Portfolio Optimization


# Deep Deterministic Portfolio Optimization









Can deep reinforcement learning algorithms be exploited as solvers for optimal trading strategies? The aim of this work is to test reinforcement learning algorithms on conceptually simple, but mathematically non-trivial, trading environments. The environments are chosen such that an optimal or close-to-optimal trading strategy is known. We study the deep deterministic policy gradient algorithm and show that such a reinforcement learning agent can successfully recover the essential features of the optimal trading strategies and achieve close-to-optimal rewards.

Полный текст с указанием источника опубликован на условиях его лицензии. Лицензия: abstract CC0

Это краткое изложение подготовлено исследовательским агентом Stratmill по оригиналу и не является его копией.