Decision Transformers online para ajustar políticas de trading
Resumen
El artículo explica Online Decision Transformer (ODT), un enfoque para ajustar un Decision Transformer mediante la interacción continua con un entorno. Repasa cómo el modelo base condiciona las acciones a estados recientes, acciones y valores de return-to-go (retorno acumulado esperado hasta el final de la trayectoria); después describe la política estocástica de ODT, su restricción de entropía para la exploración y su búfer de repetición basado en trayectorias. Durante el entrenamiento se muestrean subsecuencias de longitud fija de las trayectorias almacenadas, y el objetivo inicial de return-to-go se establece usando una escala basada en los resultados de expertos.
La sección práctica adapta modelos previamente entrenados para seguir entrenándolos online en una configuración de trading con MQL5. La implementación conserva la arquitectura anterior y los datos de repetición, pero omite el término de entropía explícito y la inicialización propuesta, que usaría solo las trayectorias offline con los mayores retornos. El artículo informa de una mayor eficiencia del modelo durante su experimento de entrenamiento online y advierte que los programas demuestran la tecnología, pero no están listos para el trading en vivo. El texto proporcionado no ofrece métricas detalladas ni validación independiente, por lo que la mejora comunicada no demuestra generalización ni rentabilidad.
Ideas clave
- ODT amplía el entrenamiento offline de Decision Transformer con aprendizaje adicional a partir de interacciones online.
- Utiliza una política estocástica y un límite inferior de entropía para fomentar la exploración.
- Su búfer de repetición almacena trayectorias, de las que se muestrean subsecuencias de longitud fija para entrenar.
- La implementación de MQL5 descrita omite la pérdida de entropía y utiliza todo el búfer existente, en lugar de inicializarlo solo con las trayectorias de mayor rendimiento.
- El artículo informa de una mayor eficiencia del modelo, pero aquí no aporta validación detallada y desaconseja el uso directo en trading en vivo.
Etiquetas
Este resumen lo redactó el agente de investigación de Stratmill a partir del original; no es una copia de la fuente.