Especialización de modelos de lenguaje para generar código ejecutable de trading algorítmico
Resumen
El estudio evalúa formas de adaptar modelos de lenguaje generalistas para generar estrategias ejecutables en el marco Backtrader. Su enfoque combina el preentrenamiento continuo con código del marco y el ajuste fino supervisado con ejemplos de solicitudes convertidas en código y validados por agentes. La evaluación utiliza una prueba de generación de estrategias de 400 tareas y una prueba a nivel de repositorio, que miden la corrección evaluada, los backtests completados con éxito y el rendimiento de los agentes durante varias rondas de reparación.
Ideas clave
- El preentrenamiento continuo con código de marcos de trading mejora el rendimiento evaluado en un solo turno de los modelos estudiados.
- El ajuste fino supervisado tras el preentrenamiento continuo produce mejoras mayores para un modelo, incluidas mayores tasas de éxito de backtests y de agentes.
- El preentrenamiento continuo por sí solo puede ayudar al éxito de los agentes en el primer turno y perjudicarlo tras una reparación, lo que sugiere un seguimiento más débil de las instrucciones.
- La especialización en un dominio puede deteriorar el formato estructurado de llamadas a herramientas; el ajuste fino de recuperación restablece el formato, pero no el rendimiento base de los agentes a nivel de repositorio.
- Los resultados corresponden a modelos, tareas y al marco Backtrader concretos, por lo que no demuestran el rendimiento en todos los sistemas de trading.
Etiquetas
Texto completo
# QuantCode Model: Specializing Language Models for Executable Algorithmic Trading Code # QuantCode Model: Specializing Language Models for Executable Algorithmic Trading Code Large language models are strong general-purpose code generators, but executable algorithmic trading remains a demanding specialization target: a model must translate a natural-language strategy specification into correct program logic for a specialized trading framework, execute on historical data, produce trades, and remain semantically faithful to the request. We study two complementary mechanisms for specializing language models for this setting: continued pretraining on algorithmic-trading framework code and supervised fine-tuning (SFT) on agent-validated request-to-code pairs. Evaluation is centered on QuantCode-Bench, our 400-task benchmark for Backtrader strategy generation, together with a repository-level SWE-bench-like track. Continued pretraining improves single-turn Judge Pass from 41.5% to 47.5% for Qwen3.5-397B-A17B and from 27.8% to 33.0% for Qwen3.6-35B-A3B. SFT applied after continued pretraining yields a larger gain for Qwen3.6-35B-A3B, reaching 58.2% Judge Pass and 83.5% successful backtests; in agentic evaluation it raises first-turn success from 22.3% to 58.3% and final success after up to 10 turns from 47.5% to 79.5%. Continued pretraining alone improves first-turn agentic success but lowers final success after repair from 47.5% to 32.5%, consistent with degraded instruction following, whereas SFT improves both. We also identify a capability-retention failure: domain specialization degrades parser-conformant structured tool calling, and targeted recovery SFT restores tool-call formatting but not the base checkpoint's repository-level agent performance. The results show that framework-oriented pretraining, validated SFT, and explicit capability-retention evaluation address distinct failure modes in domain-specific executable code generation.
Se muestra íntegramente con atribución según la licencia de la fuente. Licencia: abstract CC0
Este resumen lo redactó el agente de investigación de Stratmill a partir del original; no es una copia de la fuente.