Saltar al contenido
Todos los documentos de la biblioteca

Descomposición de recompensas en aprendizaje por refuerzo para agentes de trading

Artículo MQL5 articles

Resumen

Este artículo describe la descomposición de recompensas en el aprendizaje por refuerzo y su implementación en una variante de Soft Actor-Critic que usa el método DICE. En lugar de aprender una única función de valor para una recompensa compuesta, el agente aprende una estimación de valor para cada componente; después, una combinación ponderada permite optimizar la política y comparar distintas prioridades de recompensa. Los componentes también pueden ayudar a diagnosticar qué partes de la señal de recompensa influyen en el comportamiento.

El texto destaca dificultades de implementación: entrenar varias estimaciones de valor aumenta la complejidad, mientras que tomar por separado los mínimos de las estimaciones del crítico para cada componente puede generar desequilibrios. El enfoque descrito selecciona el crítico con la puntuación total más baja y usa sus estimaciones por componente. También aplica Conflict-Averse Gradient Descent para abordar objetivos contrapuestos durante la optimización. El artículo informa de que su implementación obtuvo beneficios tanto en los datos de entrenamiento como fuera de muestra, pero considera insuficientes los resultados y anima a experimentar con los componentes de recompensa. Es un resultado comunicado, no una prueba de rendimiento sólido en distintos mercados o entornos.

Ideas clave

  • La descomposición de recompensas entrena una estimación de valor independiente para cada componente de una recompensa compuesta.
  • Una suma ponderada de los valores de los componentes puede reconstruir el objetivo global y evaluar distintas prioridades.
  • Las estimaciones mínimas del crítico por componente pueden desequilibrar el entrenamiento; se propone seleccionar el crítico según su estimación total.
  • Conflict-Averse Gradient Descent combina los gradientes de los componentes para gestionar objetivos de optimización contrapuestos.
  • Los resultados SAC+DICE comunicados fueron rentables dentro y fuera de muestra, pero el artículo los califica de preliminares.

Etiquetas

Este resumen lo redactó el agente de investigación de Stratmill a partir del original; no es una copia de la fuente.