Decision Transformer trực tuyến để tinh chỉnh chính sách giao dịch
Tóm tắt
Bài viết giải thích Online Decision Transformer (ODT), một phương pháp tinh chỉnh Decision Transformer thông qua tương tác liên tục với môi trường. Bài viết xem xét cách mô hình cơ sở điều kiện hóa hành động dựa trên trạng thái gần đây, hành động và giá trị lợi suất còn cần đạt, rồi mô tả chính sách ngẫu nhiên, ràng buộc entropy để khám phá và bộ đệm phát lại dựa trên quỹ đạo của ODT. Quá trình huấn luyện lấy các chuỗi con có độ dài cố định từ quỹ đạo đã lưu; mục tiêu lợi suất còn cần đạt ban đầu được thiết lập theo thang đo dựa trên kết quả chuyên gia.
Phần thực hành điều chỉnh các mô hình đã huấn luyện trước đó để tiếp tục huấn luyện trực tuyến trong thiết lập giao dịch MQL5. Cách triển khai giữ lại kiến trúc và dữ liệu phát lại trước đó, nhưng bỏ thành phần entropy tường minh và cách khởi tạo được đề xuất chỉ bằng các quỹ đạo ngoại tuyến có lợi suất cao nhất. Bài viết báo cáo hiệu quả mô hình được cải thiện trong thử nghiệm huấn luyện trực tuyến, đồng thời lưu ý rằng các chương trình chỉ minh họa công nghệ và chưa sẵn sàng cho giao dịch thực. Văn bản được cung cấp không có số liệu chi tiết hay xác thực độc lập, nên cải thiện được báo cáo không xác lập khả năng khái quát hóa hay sinh lời.
Ý chính
- ODT mở rộng quá trình huấn luyện Decision Transformer ngoại tuyến bằng việc tiếp tục học từ tương tác trực tuyến.
- Phương pháp dùng chính sách ngẫu nhiên và giới hạn entropy dưới để khuyến khích khám phá.
- Bộ đệm phát lại lưu trữ quỹ đạo, từ đó lấy các chuỗi con có độ dài cố định để huấn luyện.
- Cách triển khai MQL5 được mô tả bỏ hàm mất mát entropy và dùng toàn bộ bộ đệm hiện có thay vì chỉ khởi tạo bằng các quỹ đạo hiệu suất cao nhất.
- Bài viết báo cáo hiệu quả mô hình được cải thiện nhưng không cung cấp xác thực chi tiết ở đây và cảnh báo không dùng trực tiếp trong giao dịch thực.
Thẻ
Bản tóm tắt này do tác nhân nghiên cứu của Stratmill biên soạn từ tài liệu gốc; đây không phải bản sao của tài liệu.