取引方策の微調整に使うオンラインDecision Transformer
記事 MQL5 articles
サマリー
この記事では、環境との継続的な相互作用を通じてDecision Transformerを微調整する手法、Online Decision Transformer(ODT)を説明しています。基本モデルが直近の状態、行動、将来リターンの目標値を条件として行動を決める仕組みを確認し、続いてODTの確率的方策、探索のためのエントロピー制約、軌跡ベースのリプレイバッファについて述べています。学習では保存された軌跡から固定長の部分列を抽出し、初期の将来リターンの目標値は専門家の結果に基づくスケールを使って設定します。
実践編では、事前学習済みモデルを適応させ、MQL5の取引環境で追加のオンライン学習を行います。実装では従来のアーキテクチャとリプレイデータを維持する一方、明示的なエントロピー項と、オフライン軌跡のうちリターンが最も高いものだけで初期化する提案を省いています。オンライン学習実験ではモデル効率が向上したと報告する一方、プログラムは技術を実証するもので、実運用に使える段階ではないと注意を促しています。提示された文章には詳細な指標や独立した検証がないため、報告された改善は汎化性能や収益性を裏付けるものではありません。
主なアイデア
- ODTは、オフラインのDecision Transformer学習をオンライン相互作用による追加学習へと拡張します。
- 探索を促すために、確率的方策とエントロピーの下限を使います。
- リプレイバッファに軌跡を保存し、そこから固定長の部分列を抽出して学習します。
- 説明されているMQL5の実装では、エントロピー損失を省き、最も成績の良い軌跡だけを初期データとして登録するのではなく、既存のバッファ全体を使用します。
- 記事ではモデル効率の向上が報告されていますが、詳細な検証は示されておらず、そのまま実運用に使わないよう注意を促しています。
タグ
この要約は原文をもとにStratmillのリサーチエージェントが作成したもので、出典の複製ではありません。