Pular para o conteúdo
Todos os documentos da biblioteca

Aprendizado por reforço hierárquico com modelos de linguagem para pair trading

Artigo arXiv papers · Autor: Polydoros Giannouris et al.

Resumo

Este trabalho formula o pair trading como um problema hierárquico de decisão com duas etapas relacionadas: selecionar um par de ativos em um horizonte mais longo e executar operações em horizontes mais curtos sob observabilidade parcial. Como o feedback chega com atraso e pode ser ambíguo, resultados ruins podem decorrer da escolha do par, da política de execução ou de ambos. O método proposto usa modelos de linguagem grandes como políticas nos dois níveis e os adapta por meio de atualizações de prompts, em vez de ajuste fino baseado em gradientes.

O feedback textual nos níveis de trajetória e episódio é usado para ajustar separadamente as abstrações de seleção de pares e o comportamento de execução. Os autores argumentam que essa separação ajuda a isolar as fontes de mudanças no desempenho e reduz a instabilidade entre os dois níveis de política. Relata-se que experimentos com dados de mercado reais mostram melhorias consistentes em relação a referências tradicionais e baseadas em LLM. O documento não especifica os conjuntos de dados, os custos de negociação, os controles de risco ou o desenho da avaliação; assim, só com essa descrição não é possível avaliar a viabilidade no trading ao vivo nem o alcance da generalização dos resultados.

Ideias principais

  • A abordagem separa a seleção de pares em horizontes longos da execução de operações em horizontes mais curtos.
  • Modelos de linguagem grandes atuam como políticas nos dois níveis da hierarquia de trading.
  • Atualizações de prompts usam feedback textual para adaptar políticas sem ajuste fino baseado em gradientes.
  • Os experimentos relatados com dados de mercado reais superam referências tradicionais e baseadas em LLM, embora os detalhes da avaliação não sejam fornecidos.

Tags

Texto completo
# Moira: Language-driven Hierarchical Reinforcement Learning for Pair Trading


# Moira: Language-driven Hierarchical Reinforcement Learning for Pair Trading









Many sequential decision-making problems exhibit hierarchical structure, where high-level semantic choices constrain downstream actions and feedback is delayed and ambiguous. Learning in such settings is challenging due to credit assignment: performance degradation may arise from flawed abstractions, suboptimal execution, or their interaction. We study this challenge through pair trading, a domain that naturally combines long-horizon semantic reasoning for asset pair selection with short-horizon execution under partial observability. We formulate pair trading as a hierarchical reinforcement learning problem and propose a language-driven optimization framework in which both high-level and low-level policies are parameterized by large language models (LLMs) and optimized exclusively through prompt updates. Our approach leverages pretrained LLMs as hierarchical policies and uses trajectory- and episode-level textual feedback to adapt abstractions and execution without gradient-based fine-tuning. By explicitly separating abstraction selection from execution, the framework reduces non-stationarity across hierarchical levels and enables targeted adaptation under delayed feedback. Experiments on real-world market data show consistent improvements over traditional and LLM-based baselines, demonstrating the effectiveness of language-driven hierarchical reinforcement learning.

Exibido na íntegra, com atribuição conforme a licença da fonte. Licença: abstract CC0

Este resumo foi escrito pelo agente de pesquisa da Stratmill com base no original; não é uma cópia da fonte.