Hierarchisches Reinforcement Learning mit Sprachmodellen für Pair Trading
Zusammenfassung
Diese Arbeit fasst Pair Trading als hierarchisches Entscheidungsproblem mit zwei verbundenen Stufen auf: der Auswahl eines Wertpapierpaars über einen längeren Horizont und der Ausführung von Trades über kürzere Horizonte bei teilweiser Beobachtbarkeit. Da Rückmeldungen verspätet eintreffen und mehrdeutig sein können, können schlechte Ergebnisse an der Paarwahl, der Ausführungsstrategie oder an beidem liegen. Die vorgeschlagene Methode nutzt große Sprachmodelle als Strategien auf beiden Ebenen und passt sie durch Aktualisierungen von Prompts statt durch gradientenbasierte Feinabstimmung an.
Textuelles Feedback auf Trajektorien- und Episodenebene wird genutzt, um Abstraktionen der Paarauswahl und das Ausführungsverhalten getrennt anzupassen. Die Autoren argumentieren, dass diese Trennung hilft, Ursachen für Leistungsänderungen zu isolieren und Instabilität zwischen den beiden Strategieebenen zu verringern. Für Experimente mit realen Marktdaten werden beständige Verbesserungen gegenüber traditionellen und LLM-basierten Baselines berichtet. Das Dokument nennt weder Datensätze noch Handelskosten, Risikokontrollen oder das Evaluationsdesign. Anhand dieser Beschreibung allein lässt sich daher weder die Eignung für den Live-Handel noch die allgemeine Übertragbarkeit der Ergebnisse beurteilen.
Kernaussagen
- Der Ansatz trennt die Paarauswahl über längere Horizonte von der Handelsausführung über kürzere Horizonte.
- Große Sprachmodelle dienen auf beiden Ebenen der Handelshierarchie als Strategien.
- Prompt-Aktualisierungen nutzen textuelles Feedback, um Strategien ohne gradientenbasierte Feinabstimmung anzupassen.
- Berichtete Experimente mit realen Marktdaten übertreffen traditionelle und LLM-basierte Baselines, wobei Evaluationsdetails fehlen.
Schlagwörter
Volltext
# Moira: Language-driven Hierarchical Reinforcement Learning for Pair Trading # Moira: Language-driven Hierarchical Reinforcement Learning for Pair Trading Many sequential decision-making problems exhibit hierarchical structure, where high-level semantic choices constrain downstream actions and feedback is delayed and ambiguous. Learning in such settings is challenging due to credit assignment: performance degradation may arise from flawed abstractions, suboptimal execution, or their interaction. We study this challenge through pair trading, a domain that naturally combines long-horizon semantic reasoning for asset pair selection with short-horizon execution under partial observability. We formulate pair trading as a hierarchical reinforcement learning problem and propose a language-driven optimization framework in which both high-level and low-level policies are parameterized by large language models (LLMs) and optimized exclusively through prompt updates. Our approach leverages pretrained LLMs as hierarchical policies and uses trajectory- and episode-level textual feedback to adapt abstractions and execution without gradient-based fine-tuning. By explicitly separating abstraction selection from execution, the framework reduces non-stationarity across hierarchical levels and enables targeted adaptation under delayed feedback. Experiments on real-world market data show consistent improvements over traditional and LLM-based baselines, demonstrating the effectiveness of language-driven hierarchical reinforcement learning.
Vollständig mit Quellenangabe unter der Lizenz der Quelle angezeigt. Lizenz: abstract CC0
Diese Zusammenfassung wurde vom Research-Agenten von Stratmill anhand des Originals verfasst; sie ist keine Kopie der Quelle.