Выпуклые цели риска в обучении с подкреплением для трейдинга
Сводка
В работе представлена система обучения с подкреплением для задач принятия решений с целями по риску, выраженными через выпуклые оценочные функции. В системе можно представить такие меры, как дисперсия, ожидаемый дефицит и энтропийная стоимость под риском, а также полезность с учётом среднего и риска. Основное внимание уделяется применению этих целей во времени, поскольку оптимизация риска может приводить к временной несогласованности: предпочтительная на раннем этапе политика может перестать быть предпочтительной в более поздний момент принятия решения.
Чтобы решить эту проблему, авторы дополняют состояние вспомогательной переменной и преобразуют задачу в оптимизацию по двум состояниям. Они описывают адаптированный алгоритм Actor-Critic, теоретические гарантии приближения, не требующие непрерывного марковского процесса принятия решений, и процедуру выборки со вспомогательной переменной, основанную на чередующейся минимизации. В работе сообщается об экспериментах с моделированием, включая пример статистического арбитража, как свидетельстве эффективности метода. В доступном описании нет численных результатов и подробностей экспериментов; сходимость метода выборки зависит от заявленных предположений, поэтому практическая эффективность за пределами проверенных симуляций неясна.
Ключевые идеи
- Выпуклые оценочные функции позволяют выражать несколько известных мер риска в рамках целевой функции обучения с подкреплением.
- Дополнение состояния вспомогательной переменной помогает справиться с временной несогласованностью при решениях с учётом риска.
- Для предложенного метода Actor-Critic приведены гарантии приближения, не требующие непрерывного процесса состояний.
- Сообщается, что метод выборки на основе чередующейся минимизации сходится при определённых условиях.
- Эксперименты с моделированием включают приложение к торговле на основе статистического арбитража.
Теги
Полный текст
# Risk-sensitive Reinforcement Learning Based on Convex Scoring Functions # Risk-sensitive Reinforcement Learning Based on Convex Scoring Functions We propose a reinforcement learning (RL) framework under a broad class of risk objectives, characterized by convex scoring functions. This class covers many common risk measures, such as variance, Expected Shortfall, entropic Value-at-Risk, and mean-risk utility. To resolve the time-inconsistency issue, we consider an augmented state space and an auxiliary variable and recast the problem as a two-state optimization problem. We propose a customized Actor-Critic algorithm and establish some theoretical approximation guarantees. A key theoretical contribution is that our results do not require the Markov decision process to be continuous. Additionally, we propose an auxiliary variable sampling method inspired by the alternating minimization algorithm, which is convergent under certain conditions. We validate our approach in simulation experiments with a financial application in statistical arbitrage trading, demonstrating the effectiveness of the algorithm.
Полный текст с указанием источника опубликован на условиях его лицензии. Лицензия: abstract CC0
Это краткое изложение подготовлено исследовательским агентом Stratmill по оригиналу и не является его копией.