Apprentissage par renforcement hiérarchique avec modèles de langage pour le trading par paires
Résumé
Ce travail présente le trading par paires comme un problème de décision hiérarchique en deux étapes liées : sélectionner une paire d’actifs sur un horizon plus long, puis exécuter des transactions sur des horizons plus courts avec une observabilité partielle. Comme les retours d’information arrivent tard et peuvent être ambigus, les mauvais résultats peuvent provenir du choix de la paire, de la politique d’exécution ou des deux. La méthode proposée utilise de grands modèles de langage comme politiques aux deux niveaux et les adapte par des mises à jour des prompts plutôt que par un ajustement fin fondé sur le gradient.
Les retours textuels aux niveaux de la trajectoire et de l’épisode servent à ajuster séparément les représentations de sélection des paires et le comportement d’exécution. Les auteurs avancent que cette séparation aide à isoler les sources de variation des performances et à réduire l’instabilité entre les deux niveaux de politique. Des expériences sur des données de marché réelles font état d’améliorations régulières par rapport aux références traditionnelles et fondées sur LLM. Le document ne précise ni les jeux de données, ni les coûts de trading, ni les contrôles du risque, ni le protocole d’évaluation ; cette description seule ne permet donc pas de juger si la méthode est applicable au trading en réel ni dans quelle mesure les résultats se généralisent.
Idées clés
- L’approche sépare la sélection de paires à long horizon de l’exécution des transactions à plus court horizon.
- De grands modèles de langage servent de politiques aux deux niveaux de la hiérarchie de trading.
- Des mises à jour des prompts utilisent des retours textuels pour adapter les politiques sans ajustement fin fondé sur le gradient.
- Les expériences rapportées sur des données de marché réelles surpassent les références traditionnelles et fondées sur LLM, mais les détails d’évaluation ne sont pas fournis.
Étiquettes
Texte intégral
# Moira: Language-driven Hierarchical Reinforcement Learning for Pair Trading # Moira: Language-driven Hierarchical Reinforcement Learning for Pair Trading Many sequential decision-making problems exhibit hierarchical structure, where high-level semantic choices constrain downstream actions and feedback is delayed and ambiguous. Learning in such settings is challenging due to credit assignment: performance degradation may arise from flawed abstractions, suboptimal execution, or their interaction. We study this challenge through pair trading, a domain that naturally combines long-horizon semantic reasoning for asset pair selection with short-horizon execution under partial observability. We formulate pair trading as a hierarchical reinforcement learning problem and propose a language-driven optimization framework in which both high-level and low-level policies are parameterized by large language models (LLMs) and optimized exclusively through prompt updates. Our approach leverages pretrained LLMs as hierarchical policies and uses trajectory- and episode-level textual feedback to adapt abstractions and execution without gradient-based fine-tuning. By explicitly separating abstraction selection from execution, the framework reduces non-stationarity across hierarchical levels and enables targeted adaptation under delayed feedback. Experiments on real-world market data show consistent improvements over traditional and LLM-based baselines, demonstrating the effectiveness of language-driven hierarchical reinforcement learning.
Reproduit dans son intégralité avec attribution, conformément à la licence de la source. Licence: abstract CC0
Ce résumé a été rédigé par l’agent de recherche de Stratmill à partir de la source originale ; il n’en est pas une copie.