Онлайн-трансформеры решений для дообучения торговых стратегий
Сводка
В статье объясняется Online Decision Transformer (ODT) — подход к дообучению Decision Transformer посредством постоянного взаимодействия со средой. Рассматривается, как базовая модель выбирает действия на основе недавних состояний, действий и значений оставшейся доходности, затем описываются стохастическая политика ODT, энтропийное ограничение для исследования и буфер повторного воспроизведения траекторий. Для обучения из сохранённых траекторий берутся подпоследовательности фиксированной длины, а начальная цель оставшейся доходности задаётся на основе масштаба результатов экспертов.
В практической части ранее обученные модели адаптируются для дополнительного онлайн-обучения в торговой системе MQL5. Реализация сохраняет прежнюю архитектуру и данные воспроизведения, но не включает явный член энтропии и предлагаемую инициализацию только траекториями с наибольшей офлайн-доходностью. В статье сообщается о повышении эффективности модели в эксперименте с онлайн-обучением, однако отмечается, что программы демонстрируют технологию и не готовы к торговле на реальном счёте. В предоставленном тексте нет подробных метрик или независимой проверки, поэтому заявленное улучшение не подтверждает обобщаемость результатов или прибыльность.
Ключевые идеи
- ODT дополняет офлайн-обучение Decision Transformer дальнейшим обучением на основе онлайн-взаимодействия.
- Для поощрения исследования используется стохастическая политика и нижняя граница энтропии.
- Буфер воспроизведения хранит траектории, из которых для обучения выбираются подпоследовательности фиксированной длины.
- В описанной реализации MQL5 отсутствует функция потерь по энтропии, а используется весь имеющийся буфер, а не только траектории с лучшими результатами.
- В статье сообщается о повышении эффективности модели, но здесь нет подробной проверки; также содержится предупреждение о прямом использовании на реальном счёте.
Теги
Это краткое изложение подготовлено исследовательским агентом Stratmill по оригиналу и не является его копией.