株式執行における公平性を考慮したマルチエージェント強化学習
記事 arXiv papers · 著者: Wenhang Bao
サマリー
複数の顧客が同じ資産を求め、注文サイズ、期間、リスク選好が異なる場合に、取引デスクが注文をどう執行すべきかを論じています。先行する約定が価格を動かすことがあるため、取引収益の合計を最大化すると、後から執行される注文の顧客が不利になる可能性があります。提案するフレームワークでは、マルチエージェント強化学習を用いて各顧客の戦略を個別に開発しながら、グループ全体の成果のバランスを取ります。
一般化ジニ指数で顧客ごとの収益を集約し、収益最適化と並行して公平性の目的を調整する方法を示します。著者らは、この手法で収益最適化を維持しながら公平性が向上する実証的証拠を報告し、強化学習は市場環境の変化に応じて戦略を適応できると論じています。提示された説明にはデータセット、実験設定、数値結果、比較の詳細がありません。そのため、この文章だけでは実証的な主張の強さや一般化可能性を評価できません。
主なアイデア
- 顧客注文の執行では、取引収益の合計を最大化することと顧客を公平に扱うことが相反する場合があります。
- 先行注文が価格に影響し、後続の執行コストを押し上げることがあります。
- マルチエージェント強化学習を使い、顧客ごとの執行戦略を学習します。
- 一般化ジニ指数によって、収益集約に分配上の公平性を取り入れます。
- 公平性を改善しながら収益最適化を維持すると主張していますが、証拠の評価に必要な詳細は限られています。
タグ
全文
# Fairness in Multi-agent Reinforcement Learning for Stock Trading # Fairness in Multi-agent Reinforcement Learning for Stock Trading Unfair stock trading strategies have been shown to be one of the most negative perceptions that customers can have concerning trading and may result in long-term losses for a company. Investment banks usually place trading orders for multiple clients with the same target assets but different order sizes and diverse requirements such as time frame and risk aversion level, thereby total earning and individual earning cannot be optimized at the same time. Orders executed earlier would affect the market price level, so late execution usually means additional implementation cost. In this paper, we propose a novel scheme that utilizes multi-agent reinforcement learning systems to derive stock trading strategies for all clients which keep a balance between revenue and fairness. First, we demonstrate that Reinforcement learning (RL) is able to learn from experience and adapt the trading strategies to the complex market environment. Secondly, we show that the Multi-agent RL system allows developing trading strategies for all clients individually, thus optimizing individual revenue. Thirdly, we use the Generalized Gini Index (GGI) aggregation function to control the fairness level of the revenue across all clients. Lastly, we empirically demonstrate the superiority of the novel scheme in improving fairness meanwhile maintaining optimization of revenue.
出典を明記したうえで、ライセンスに従って全文を掲載しています。 ライセンス: abstract CC0
この要約は原文をもとにStratmillのリサーチエージェントが作成したもので、出典の複製ではありません。