Перейти к содержимому
Все документы библиотеки

Робастное обучение с подкреплением для портфельных стратегий с учётом риска

Статья arXiv papers · Автор: Sebastian Jaimungal et al.

Сводка

В работе разрабатывается подход к обучению с подкреплением для оптимизации политик по критериям, учитывающим риск. Политики оцениваются с помощью ранговой ожидаемой полезности, позволяющей агенту задавать разные предпочтения относительно прибыли и неблагоприятных исходов. Чтобы учесть неопределённость модели, политика проверяется на наихудшем распределении доходности внутри шара расстояния Васерштейна вокруг смоделированного распределения. Возникает вложенная задача принятия решений: агент выбирает политику, а затем противник выбирает близкое распределение, снижающее её результативность.

Авторы выводят формулы градиента политики как для выбора политики, так и для задачи противника, выбирающего распределение, которое ухудшает её результаты. Метод демонстрируется на робастном распределении портфеля, оптимизации бенчмарка и статистическом арбитраже. Эти примеры показывают предполагаемую область применения подхода, однако документ не приводит сравнительных показателей результатов, подробностей о рыночных данных или практических рекомендаций по реализации. Поэтому его полезность зависит от дополнительной проверки модели, множества неопределённости и предпочтений по риску в конкретных условиях торговли.

Ключевые идеи

  • Ранговая ожидаемая полезность позволяет задавать в политике разные компромиссы между прибылью и риском убытков.
  • Согласно подходу, каждая политика оценивается на наихудшем распределении внутри окрестности Васерштейна.
  • Во вложенной задаче противодействия ищется распределение, которое снижает результативность выбранной политики.
  • Авторы выводят градиенты политики как для оптимизации политики, так и для задачи, в которой противник выбирает распределение.
  • Метод демонстрируется на задачах распределения портфеля, оптимизации бенчмарка и статистического арбитража.

Теги

Полный текст
# Robust Risk-Aware Reinforcement Learning


# Robust Risk-Aware Reinforcement Learning









We present a reinforcement learning (RL) approach for robust optimisation of risk-aware performance criteria. To allow agents to express a wide variety of risk-reward profiles, we assess the value of a policy using rank dependent expected utility (RDEU). RDEU allows the agent to seek gains, while simultaneously protecting themselves against downside risk. To robustify optimal policies against model uncertainty, we assess a policy not by its distribution, but rather, by the worst possible distribution that lies within a Wasserstein ball around it. Thus, our problem formulation may be viewed as an actor/agent choosing a policy (the outer problem), and the adversary then acting to worsen the performance of that strategy (the inner problem). We develop explicit policy gradient formulae for the inner and outer problems, and show its efficacy on three prototypical financial problems: robust portfolio allocation, optimising a benchmark, and statistical arbitrage.

Полный текст с указанием источника опубликован на условиях его лицензии. Лицензия: abstract CC0

Это краткое изложение подготовлено исследовательским агентом Stratmill по оригиналу и не является его копией.