Transformers preentrenados para valorar acciones e invertir en factores
Resumen
El artículo propone un modelo Transformer unidireccional, SERT, para valorar acciones estadounidenses de gran capitalización US y aplica Transformers preentrenados a la valoración de acciones y la inversión en factores. Compara estos enfoques con Transformers estándar y solo con codificador en los periodos anterior a la pandemia, durante la pandemia y durante el año posterior, prestando atención al rendimiento en momentos de tensión del mercado. Los autores señalan que SERT obtiene el R² fuera de muestra más alto durante las fluctuaciones extremas del mercado, seguido de los Transformers preentrenados.
Se presenta una estrategia de seguimiento de tendencias basada en los modelos como forma de cubrir el riesgo a la baja durante las perturbaciones. En el escenario de costes de transacción estáticos del periodo pandémico, el ratio de Sortino de SERT supera, según se informa, al de comprar y mantener en 47% para una cartera equiponderada y en 28% para una ponderada por valor. El artículo también concluye que un filtro de señales softmax no mejora el rendimiento de la estrategia, que añadir cabezas de atención solo produce mejoras insignificantes y que aplicar primero la normalización de capas no ayuda en este caso. Estos resultados corresponden a los periodos y la configuración del estudio; el texto facilitado no indica los supuestos sobre costes de transacción ni ofrece detalles de validación más amplios.
Ideas clave
- Se propone SERT para valorar acciones de gran capitalización de US, junto con enfoques basados en Transformers preentrenados.
- Los modelos se comparan con Transformers estándar y solo de codificador en tres periodos que abarcan la pandemia de COVID-19.
- SERT obtiene el R² fuera de muestra más alto de los resultados comunicados durante las fluctuaciones extremas del mercado.
- La estrategia de seguimiento de tendencias basada en el modelo se presenta como cobertura frente al riesgo a la baja durante las perturbaciones.
- En el escenario de costes indicado para el periodo pandémico, el ratio de Sortino de SERT supera al de comprar y mantener con ambos métodos de ponderación de cartera.
- El filtro softmax probado, las cabezas de atención adicionales y el orden de normalización de capas no mejoran de forma sustancial el rendimiento de la estrategia.
Etiquetas
Texto completo
# Asset Pricing in Pre-trained Transformer # Asset Pricing in Pre-trained Transformer This paper proposes an innovative Transformer model, Single-directional representative from Transformer (SERT), for US large capital stock pricing. It also innovatively applies the pre-trained Transformer models under the stock pricing and factor investment context. They are compared with standard Transformer models and encoder-only Transformer models in three periods covering the entire COVID-19 pandemic to examine the model adaptivity and suitability during the extreme market fluctuations. Namely, pre-COVID-19 period, COVID-19 period and 1-year post-COVID-19. The best proposed SERT model achieves the highest out-of-sample $R^2$, 11.94\% and 11.47\% respectively, when extreme market fluctuation takes place, followed by pre-trained Transformer models (11.13\% and 9.72\%). Their Trend-following-based strategy's performance also proves their excellent capability for hedging downside risks during market shocks. The proposed SERT model achieves a Sortino ratio 47\% higher than the buy-and-hold benchmark in the equal-weighted portfolio and 28\% higher in the value-weighted portfolio in the static transaction cost scenario when the pandemic period is considered. It proves that Transformer models have a strong ability to capture patterns of temporal sparsity in asset pricing factor models, especially with high volatility. I also find the softmax signal filter as the common configuration of Transformer models in alternative contexts, which only eliminates differences between models, but does not improve strategy-wise performance, while increasing attention heads improves the model performance insignificantly and applying the 'layer normalization first' method does not boost the model performance in our case.
Se muestra íntegramente con atribución según la licencia de la fuente. Licencia: abstract CC0
Este resumen lo redactó el agente de investigación de Stratmill a partir del original; no es una copia de la fuente.