Диагностика PPO относительно аналитической торговой политики брокера
Сводка
В исследовании проверяется, может ли проксимальная оптимизация политики научиться принимать решения о скорости торговли брокера в игре «брокер—трейдер» с непрерывным временем, для которой известно аналитическое решение. Авторы выводят дискретное вознаграждение из целевой функции для непрерывного времени и проверяют реализацию с помощью уточнения сетки и тождества за один шаг. Затем они сравнивают выученные политики с аналитическим эталоном в условиях со стохастическим потоком неинформированных заявок и без него, а также при полной и частичной информации.
При отсутствии неинформированного потока полносвязная политика PPO приближается к эталонному действию. При стохастическом потоке полносвязные и рекуррентные политики PPO остаются неточными, хотя обучение с учителем показывает, что их акторы способны представить целевую политику. Диагностика методом Монте-Карло указывает, что критическим сетям трудно ранжировать близкие действия, а формирование вознаграждения не даёт надёжного улучшения. Контроллер на основе истории с эквивалентом определённости ближе к эталону при частичной информации. PPO адаптирует замороженную аналитическую политику к изменившимся издержкам исполнения, однако сообщённый выигрыш закрывает лишь малую часть разрыва с новым эталоном. Результаты показывают как ценность аналитических эталонов, так и ограничения проверенных методов RL.
Ключевые идеи
- Игра с аналитическим решением даёт прямой эталон для оценки политики обучения с подкреплением.
- PPO приближается к эталонному действию без стохастического потока неинформированных заявок, но в проверенном стохастическом сценарии работает неточно.
- Способность актора представлять целевую политику не гарантирует точных решений, если критик ненадёжно ранжирует действия.
- Причинный контроллер на основе наблюдаемой истории ближе к эталону при частичной информации.
- Инициализация PPO аналитической политикой позволяет частично адаптироваться к изменившимся издержкам исполнения.
Теги
Полный текст
# When a Correct Reward Is Not Enough: Diagnosing and Guiding PPO in an Analytically Solved Broker-Trader Game # When a Correct Reward Is Not Enough: Diagnosing and Guiding PPO in an Analytically Solved Broker-Trader Game Reinforcement learning (RL) is increasingly used for financial optimal-control problems when complex dynamics make analytical strategies difficult to obtain. There are financial mathematics literactures which provides many solved models whose equations and controls could evaluate and guide learning; we ask whether RL can exploit these results. We place a proximal policy optimisation (PPO) agent in an analytically solved continuous-time broker--trader game. PPO replaces the broker and chooses its trading speed while interacting with an informed trader and stochastic uninformed order flow. We derive a finite-step reward from the broker's continuous-time payoff and verify its discrete implementation through grid refinement and an exact one-step identity. With zero uninformed flow, a validation-selected PPO--FFNN approaches the reference action. With stochastic uninformed flow, the tested PPO--FFNN and PPO--LSTM remain inaccurate, although supervised learning confirms that their actors can represent the action. Monte Carlo diagnostics show that their critics do not reliably rank nearby actions; potential-based reward shaping also gives no reliable improvement. Under partial information, a causal certainty-equivalent controller based on the broker's observable history remains close to the reference, while PPO has larger errors and lower payoffs. Finally, we freeze the analytical policy and train PPO to adjust it after the execution cost changes. Halving the cost yields a repeatable improvement that closes \(2.22\%\) of the gap to the changed-cost reference. The analytical solution therefore provides both a benchmark for diagnosing RL and a useful starting policy for adaptation.
Полный текст с указанием источника опубликован на условиях его лицензии. Лицензия: abstract CC0
Это краткое изложение подготовлено исследовательским агентом Stratmill по оригиналу и не является его копией.