Aprendizaje por refuerzo jerárquico con modelos de lenguaje para trading por pares
Resumen
Este trabajo plantea el trading por pares como un problema de decisión jerárquico con dos etapas relacionadas: seleccionar un par de activos en un horizonte más largo y ejecutar operaciones en horizontes más cortos bajo observabilidad parcial. Como la retroalimentación llega tarde y puede ser ambigua, los malos resultados pueden deberse a la elección del par, a la política de ejecución o a ambas. El método propuesto utiliza modelos de lenguaje grandes como políticas en ambos niveles y los adapta mediante actualizaciones de prompts, en lugar de un ajuste fino basado en gradientes.
La retroalimentación textual a nivel de trayectoria y episodio se utiliza para ajustar por separado las abstracciones de selección de pares y la conducta de ejecución. Los autores sostienen que esta separación ayuda a aislar las fuentes de los cambios de rendimiento y reduce la inestabilidad entre los dos niveles de política. Se informa de que los experimentos con datos de mercado reales muestran mejoras constantes frente a referencias tradicionales y basadas en LLM. El documento no especifica los conjuntos de datos, los costes de negociación, los controles de riesgo ni el diseño de evaluación; por ello, esta descripción por sí sola no permite juzgar si el método es viable para operar en mercados reales ni cuánto se generalizan los resultados.
Ideas clave
- El enfoque separa la selección de pares en horizontes largos de la ejecución de operaciones en horizontes más cortos.
- Los modelos de lenguaje grandes actúan como políticas en ambos niveles de la jerarquía de negociación.
- Las actualizaciones de prompts utilizan retroalimentación textual para adaptar las políticas sin ajuste fino basado en gradientes.
- Los experimentos informados con datos de mercado reales superan a referencias tradicionales y basadas en LLM, aunque no se ofrecen detalles de la evaluación.
Etiquetas
Texto completo
# Moira: Language-driven Hierarchical Reinforcement Learning for Pair Trading # Moira: Language-driven Hierarchical Reinforcement Learning for Pair Trading Many sequential decision-making problems exhibit hierarchical structure, where high-level semantic choices constrain downstream actions and feedback is delayed and ambiguous. Learning in such settings is challenging due to credit assignment: performance degradation may arise from flawed abstractions, suboptimal execution, or their interaction. We study this challenge through pair trading, a domain that naturally combines long-horizon semantic reasoning for asset pair selection with short-horizon execution under partial observability. We formulate pair trading as a hierarchical reinforcement learning problem and propose a language-driven optimization framework in which both high-level and low-level policies are parameterized by large language models (LLMs) and optimized exclusively through prompt updates. Our approach leverages pretrained LLMs as hierarchical policies and uses trajectory- and episode-level textual feedback to adapt abstractions and execution without gradient-based fine-tuning. By explicitly separating abstraction selection from execution, the framework reduces non-stationarity across hierarchical levels and enables targeted adaptation under delayed feedback. Experiments on real-world market data show consistent improvements over traditional and LLM-based baselines, demonstrating the effectiveness of language-driven hierarchical reinforcement learning.
Se muestra íntegramente con atribución según la licencia de la fuente. Licencia: abstract CC0
Este resumen lo redactó el agente de investigación de Stratmill a partir del original; no es una copia de la fuente.