Перейти к содержимому
Все документы библиотеки

Глубокое обучение с подкреплением выявляет карательные реакции в играх исполнения заявок

Статья arXiv papers · Автор: Christos Spyridon Koulouris et al.

Сводка

В статье изучается, приобретают ли независимые агенты глубокого обучения с подкреплением поведение, согласующееся со сговором, в игре оптимального исполнения заявок. В игре ликвидации на двоих с конечным горизонтом агенты используют проксимальную оптимизацию политики и имеют доступ к истории цен и действий в рамках каждого эпизода. Издержки ликвидации, которым они научились, оказываются ниже бенчмарка Нэша; авторы описывают такие результаты как сверхконкурентные.

Чтобы выяснить причины, исследователи обучают агентов против усреднённого выученного графика ликвидации, а затем проверяют отклонение, навязывая исходному агенту первоначальную сделку агента, отклоняющегося от стратегии. Противник реагирует, продавая быстрее; во всех описанных запусках и ролях игроков эта реакция более чем сводит на нет выгоду отклонившегося агента, при этом средняя выплата наказывающего агента существенно не меняется. Авторы также проверяют, перевешивает ли наказание выгоду от отклонения и объясняются ли навязанные потери изменением торгового поведения; в проверенном случае оба условия выполняются. Результаты согласуются с интерпретацией сговора в этой конкретной моделируемой игре, но не показывают, что действующие торговые агенты вступают в сговор на реальных рынках.

Ключевые идеи

  • В изучаемой игре независимые агенты обучения с подкреплением достигают издержек ликвидации ниже бенчмарка Нэша.
  • Проверенное отклонение побуждает противника ускорить ликвидацию в качестве ответной меры.
  • Согласно результатам, наказание более чем компенсирует выгоду отклонившегося агента, сохраняя среднюю выплату наказывающего агента.
  • Авторы проверяют, перевешивает ли наказание выгоду от отклонения и объясняет ли изменение поведения потерю; для проверенного отклонения оба условия выполняются.
  • Данные получены в симулированной игре на двоих и не доказывают сговор на реальных рынках.

Теги

Полный текст
# Beyond Supra-Competitive Outcomes: Collusive Behaviour in Deep Reinforcement Learning for Optimal Execution Games


# Beyond Supra-Competitive Outcomes: Collusive Behaviour in Deep Reinforcement Learning for Optimal Execution Games









In this paper, we extend earlier findings of supra-competitive outcomes in optimal-execution games by identifying a learned punitive mechanism that deters deviations and provides behavioural evidence of collusion. We investigate this mechanism in a two-player, finite-horizon Almgren-Chriss liquidation game. Independent proximal policy optimisation agents with access to within-episode price and action histories achieve costs below the Nash benchmark. We identify a profitable deviation by training against the mean learned liquidation schedule, then impose its first trade on one of the original agents. The opponent responds by accelerating liquidation. This response more than offsets the deviator's gain in every run and both player roles, while leaving the punisher's average payoff materially unchanged relative to not punishing under the same deviation. The punisher imposes greater losses on the deviator while preserving its own average payoff, despite the availability of more profitable, less punitive liquidation plans. Matching deviations and subsequent additional selling rise and later decline during training, while final policies retain an effective punitive response. We formalise two checks: whether punishment outweighs the gain from deviating, and whether the change in trading behaviour is large enough to account for the loss imposed. Both checks hold for the tested deviation. Together, these findings provide behavioural and economic evidence supporting a collusive interpretation of the learned supra-competitive outcomes.

Полный текст с указанием источника опубликован на условиях его лицензии. Лицензия: abstract CC0

Это краткое изложение подготовлено исследовательским агентом Stratmill по оригиналу и не является его копией.