Перейти к содержимому
Все документы библиотеки

Глубокое обучение с подкреплением и выявляемые динамические спектральные меры риска

Статья arXiv papers · Автор: Anthony Coache et al.

Сводка

В документе представлена чувствительная к риску схема обучения с подкреплением, в которой агент оптимизирует динамические спектральные меры риска, согласованные во времени. Условная оцениваемость используется для построения строго согласованных оценочных функций, служащих штрафами при оценивании. Меры риска оцениваются глубокими нейронными сетями; авторы доказывают, что этот класс мер можно аппроксимировать такими сетями с произвольной точностью.

Схема также включает алгоритм «актор-критик», который обучается на полных эпизодах без добавления вложенных переходов. Авторы сравнивают его с подходом вложенного моделирования в двух задачах — статистическом арбитраже и распределении портфеля — на смоделированных и реальных данных. В описании нет численных результатов, подробностей реализации или сведений о реальных наборах данных; поэтому оно позволяет понять устройство метода и заявленный охват оценки, но не оценить прирост эффективности или устойчивость. Метод применим к портфельным решениям, где наряду с ожидаемым вознаграждением важно контролировать распределение убытков.

Ключевые идеи

  • Схема оптимизирует согласованные во времени динамические спектральные меры риска с помощью обучения с подкреплением.
  • Условная оцениваемость обеспечивает строго согласованные оценочные функции, используемые как штрафы при оценивании.
  • Глубокие нейронные сети оценивают меры риска; для этого класса мер заявлена теорема об аппроксимации.
  • Метод «актор-критик» использует полные эпизоды и позволяет обойтись без дополнительных вложенных переходов.
  • Сравнение охватывает вложенное моделирование, статистический арбитраж и распределение портфеля на смоделированных и реальных данных.

Теги

Полный текст
# Conditionally Elicitable Dynamic Risk Measures for Deep Reinforcement Learning


# Conditionally Elicitable Dynamic Risk Measures for Deep Reinforcement Learning









We propose a novel framework to solve risk-sensitive reinforcement learning (RL) problems where the agent optimises time-consistent dynamic spectral risk measures. Based on the notion of conditional elicitability, our methodology constructs (strictly consistent) scoring functions that are used as penalizers in the estimation procedure. Our contribution is threefold: we (i) devise an efficient approach to estimate a class of dynamic spectral risk measures with deep neural networks, (ii) prove that these dynamic spectral risk measures may be approximated to any arbitrary accuracy using deep neural networks, and (iii) develop a risk-sensitive actor-critic algorithm that uses full episodes and does not require any additional nested transitions. We compare our conceptually improved reinforcement learning algorithm with the nested simulation approach and illustrate its performance in two settings: statistical arbitrage and portfolio allocation on both simulated and real data.

Полный текст с указанием источника опубликован на условиях его лицензии. Лицензия: abstract CC0

Это краткое изложение подготовлено исследовательским агентом Stratmill по оригиналу и не является его копией.