Перейти к содержимому
Все документы библиотеки

Иерархическое обучение с подкреплением для торговли парами на языковых моделях

Статья arXiv papers · Автор: Polydoros Giannouris et al.

Сводка

В этой работе торговля парами представлена как иерархическая задача принятия решений из двух связанных этапов: выбор пары активов на более длинном горизонте и исполнение сделок на более коротких горизонтах при частичной наблюдаемости. Поскольку обратная связь поступает с задержкой и может быть неоднозначной, плохие результаты могут быть связаны с выбором пары, политикой исполнения или обоими факторами. Предложенный метод использует большие языковые модели как политики на обоих уровнях и адаптирует их с помощью обновления подсказок вместо тонкой настройки на основе градиентного спуска.

Текстовая обратная связь на уровне траекторий и эпизодов используется для раздельной корректировки абстракций выбора пар и поведения при исполнении. Авторы утверждают, что такое разделение помогает выявлять источники изменений результатов и снижает нестабильность между двумя уровнями политики. Согласно сообщению, эксперименты на реальных рыночных данных показывают устойчивое улучшение по сравнению с традиционными базовыми моделями и моделями на основе LLM. В документе не указаны наборы данных, торговые издержки, меры контроля риска или схема оценки, поэтому по одному этому описанию нельзя судить о пригодности для торговли на реальном счёте или о том, насколько широко обобщаются результаты.

Ключевые идеи

  • Подход разделяет выбор пар на длинном горизонте и исполнение сделок на более коротком.
  • Большие языковые модели выполняют роль политик на обоих уровнях торговой иерархии.
  • Обновление подсказок использует текстовую обратную связь для адаптации политик без тонкой настройки на основе градиентного спуска.
  • В сообщении об экспериментах на реальных рыночных данных говорится о превосходстве над традиционными базовыми моделями и моделями на основе LLM, однако подробности оценки не приведены.

Теги

Полный текст
# Moira: Language-driven Hierarchical Reinforcement Learning for Pair Trading


# Moira: Language-driven Hierarchical Reinforcement Learning for Pair Trading









Many sequential decision-making problems exhibit hierarchical structure, where high-level semantic choices constrain downstream actions and feedback is delayed and ambiguous. Learning in such settings is challenging due to credit assignment: performance degradation may arise from flawed abstractions, suboptimal execution, or their interaction. We study this challenge through pair trading, a domain that naturally combines long-horizon semantic reasoning for asset pair selection with short-horizon execution under partial observability. We formulate pair trading as a hierarchical reinforcement learning problem and propose a language-driven optimization framework in which both high-level and low-level policies are parameterized by large language models (LLMs) and optimized exclusively through prompt updates. Our approach leverages pretrained LLMs as hierarchical policies and uses trajectory- and episode-level textual feedback to adapt abstractions and execution without gradient-based fine-tuning. By explicitly separating abstraction selection from execution, the framework reduces non-stationarity across hierarchical levels and enables targeted adaptation under delayed feedback. Experiments on real-world market data show consistent improvements over traditional and LLM-based baselines, demonstrating the effectiveness of language-driven hierarchical reinforcement learning.

Полный текст с указанием источника опубликован на условиях его лицензии. Лицензия: abstract CC0

Это краткое изложение подготовлено исследовательским агентом Stratmill по оригиналу и не является его копией.