Học tăng cường mô hình ngôn ngữ phân cấp cho giao dịch cặp
Tóm tắt
Công trình xem giao dịch cặp là bài toán ra quyết định phân cấp gồm hai giai đoạn liên kết: chọn một cặp tài sản trên chân trời dài hơn và thực thi giao dịch trên các chân trời ngắn hơn trong điều kiện chỉ quan sát được một phần. Do phản hồi đến muộn và có thể không rõ ràng, kết quả kém có thể bắt nguồn từ việc chọn cặp, chính sách thực thi hoặc cả hai. Phương pháp được đề xuất dùng mô hình ngôn ngữ lớn làm chính sách ở cả hai cấp và điều chỉnh chúng bằng cập nhật prompt thay vì tinh chỉnh dựa trên gradient.
Phản hồi dạng văn bản ở cấp quỹ đạo và cấp tập được dùng để điều chỉnh riêng các khái quát hóa trong việc chọn cặp và hành vi thực thi. Các tác giả cho rằng sự tách biệt này giúp cô lập nguồn gốc của thay đổi hiệu suất và giảm bất ổn giữa hai cấp chính sách. Các thí nghiệm trên dữ liệu thị trường thực tế được báo cáo là cho thấy cải thiện nhất quán so với các mức chuẩn truyền thống và dựa trên LLM. Tài liệu không nêu bộ dữ liệu, chi phí giao dịch, biện pháp kiểm soát rủi ro hay thiết kế đánh giá, nên chỉ từ mô tả này không thể đánh giá khả năng giao dịch thực hay mức độ khái quát của kết quả.
Ý chính
- Phương pháp tách việc chọn cặp ở chân trời dài khỏi thực thi giao dịch ở chân trời ngắn hơn.
- Mô hình ngôn ngữ lớn đóng vai trò chính sách ở cả hai cấp của hệ thống phân cấp giao dịch.
- Cập nhật prompt dùng phản hồi dạng văn bản để điều chỉnh chính sách mà không tinh chỉnh dựa trên gradient.
- Các thí nghiệm được báo cáo trên dữ liệu thị trường thực tế vượt các mức chuẩn truyền thống và dựa trên LLM, dù không có chi tiết đánh giá.
Thẻ
Toàn văn
# Moira: Language-driven Hierarchical Reinforcement Learning for Pair Trading # Moira: Language-driven Hierarchical Reinforcement Learning for Pair Trading Many sequential decision-making problems exhibit hierarchical structure, where high-level semantic choices constrain downstream actions and feedback is delayed and ambiguous. Learning in such settings is challenging due to credit assignment: performance degradation may arise from flawed abstractions, suboptimal execution, or their interaction. We study this challenge through pair trading, a domain that naturally combines long-horizon semantic reasoning for asset pair selection with short-horizon execution under partial observability. We formulate pair trading as a hierarchical reinforcement learning problem and propose a language-driven optimization framework in which both high-level and low-level policies are parameterized by large language models (LLMs) and optimized exclusively through prompt updates. Our approach leverages pretrained LLMs as hierarchical policies and uses trajectory- and episode-level textual feedback to adapt abstractions and execution without gradient-based fine-tuning. By explicitly separating abstraction selection from execution, the framework reduces non-stationarity across hierarchical levels and enables targeted adaptation under delayed feedback. Experiments on real-world market data show consistent improvements over traditional and LLM-based baselines, demonstrating the effectiveness of language-driven hierarchical reinforcement learning.
Hiển thị toàn văn kèm ghi nguồn theo giấy phép của tài liệu gốc. Giấy phép: abstract CC0
Bản tóm tắt này do tác nhân nghiên cứu của Stratmill biên soạn từ tài liệu gốc; đây không phải bản sao của tài liệu.