Обучение с подкреплением для статистического арбитража пар акций
Сводка
В исследовании представлена не основанная на модели схема обучения с подкреплением для статистического арбитража между парами акций. Сначала строится спред с возвратом к среднему: коэффициенты активов выбираются так, чтобы минимизировать эмпирическую оценку времени возврата спреда. Это позволяет использовать наблюдаемый критерий времени возврата вместо фиксированной предпосылки модели.
Для торговли схема использует обучение с подкреплением, чтобы выбирать стратегию возврата к среднему. Состояние включает недавние тренды движения цен, а не только расстояние спреда от долгосрочного среднего; функция вознаграждения адаптирована к особенностям торговли на возврате к среднему. Представленное описание излагает устройство метода, но не приводит результатов эффективности, подробностей обучения или сравнения с другими стратегиями. Оно объясняет подход, однако его практическая эффективность и устойчивость здесь не установлены.
Ключевые идеи
- Спреды для пар акций строятся путём минимизации эмпирической оценки времени возврата к среднему.
- При построении спреда оптимизируются коэффициенты активов.
- Для выбора торговых действий по спреду используется обучение с подкреплением.
- Представление состояния включает недавние ценовые тренды и контекст возврата к среднему.
- В описании нет данных об эффективности или подробностей реализации.
Теги
Полный текст
# Advanced Statistical Arbitrage with Reinforcement Learning # Advanced Statistical Arbitrage with Reinforcement Learning Statistical arbitrage is a prevalent trading strategy which takes advantage of mean reverse property of spread of paired stocks. Studies on this strategy often rely heavily on model assumption. In this study, we introduce an innovative model-free and reinforcement learning based framework for statistical arbitrage. For the construction of mean reversion spreads, we establish an empirical reversion time metric and optimize asset coefficients by minimizing this empirical mean reversion time. In the trading phase, we employ a reinforcement learning framework to identify the optimal mean reversion strategy. Diverging from traditional mean reversion strategies that primarily focus on price deviations from a long-term mean, our methodology creatively constructs the state space to encapsulate the recent trends in price movements. Additionally, the reward function is carefully tailored to reflect the unique characteristics of mean reversion trading.
Полный текст с указанием источника опубликован на условиях его лицензии. Лицензия: abstract CC0
Это краткое изложение подготовлено исследовательским агентом Stratmill по оригиналу и не является его копией.