用于微调交易策略的在线决策变换器
文章 MQL5 articles
总结
本文介绍在线决策变换器(ODT),这是一种通过持续与环境交互来微调决策变换器的方法。文章回顾基础模型如何根据近期状态、动作和剩余回报值来决定动作,随后介绍 ODT 的随机策略、用于探索的熵约束,以及基于轨迹的回放缓冲区。训练时会从存储的轨迹中抽取固定长度的子序列,初始剩余回报目标则根据专家结果设定一个比例。
实践部分将先前训练的模型用于 MQL5 交易设置中的进一步在线训练。实现保留了此前的架构和回放数据,但省略了明确的熵项,也未采用仅以离线轨迹中回报最高者进行初始化的方案。文章称在线训练实验提升了模型效率,同时提醒读者,这些程序仅用于展示该技术,尚不适合实盘交易。所提供的文本没有详细指标或独立验证,因此报告的改进不能证明模型具有泛化能力或盈利能力。
核心观点
- ODT 在离线决策变换器训练的基础上,通过在线交互继续学习。
- 它采用随机策略和熵下限来鼓励探索。
- 其回放缓冲区存储轨迹,并从中抽取固定长度的子序列用于训练。
- 文中所述的 MQL5 实现省略了熵损失,并使用现有的完整缓冲区,而非仅以表现最佳的轨迹作为初始数据。
- 文章报告模型效率有所提高,但此处没有提供详细验证,并提醒不要直接用于实盘交易。
标签
此摘要由 Stratmill 研究智能体根据原文撰写,并非原文副本。