Especialização de modelos de linguagem para código executável de trading algorítmico
Artigo arXiv papers · Autor: Alexey Chernysh et al.
Resumo
O estudo avalia formas de adaptar modelos de linguagem gerais para gerar estratégias executáveis na estrutura Backtrader. A abordagem combina pré-treinamento contínuo com código da estrutura e ajuste fino supervisionado com exemplos de solicitação para código validados por agentes. A avaliação usa um benchmark de geração de estratégias com 400 tarefas e uma trilha no nível de repositório, medindo correção avaliada, backtests bem-sucedidos e desempenho dos agentes ao longo de ciclos de reparo.
Ideias principais
- O pré-treinamento contínuo com código de estruturas de trading melhora o desempenho avaliado em uma única interação nos modelos testados.
- O ajuste fino supervisionado após o pré-treinamento contínuo gera ganhos maiores para um modelo, incluindo taxas de sucesso mais altas em backtests e entre agentes.
- O pré-treinamento contínuo isolado pode ajudar o sucesso agêntico na primeira tentativa e prejudicá-lo após reparos, sugerindo menor capacidade de seguir instruções.
- A especialização de domínio pode prejudicar a formatação estruturada de chamadas de ferramentas; o ajuste fino de recuperação restaura essa formatação sem restaurar o desempenho dos agentes no nível do repositório.
- Os resultados dizem respeito a modelos, tarefas e à estrutura Backtrader específicos, portanto não comprovam desempenho em todos os sistemas de trading.
Tags
Texto completo
# QuantCode Model: Specializing Language Models for Executable Algorithmic Trading Code # QuantCode Model: Specializing Language Models for Executable Algorithmic Trading Code Large language models are strong general-purpose code generators, but executable algorithmic trading remains a demanding specialization target: a model must translate a natural-language strategy specification into correct program logic for a specialized trading framework, execute on historical data, produce trades, and remain semantically faithful to the request. We study two complementary mechanisms for specializing language models for this setting: continued pretraining on algorithmic-trading framework code and supervised fine-tuning (SFT) on agent-validated request-to-code pairs. Evaluation is centered on QuantCode-Bench, our 400-task benchmark for Backtrader strategy generation, together with a repository-level SWE-bench-like track. Continued pretraining improves single-turn Judge Pass from 41.5% to 47.5% for Qwen3.5-397B-A17B and from 27.8% to 33.0% for Qwen3.6-35B-A3B. SFT applied after continued pretraining yields a larger gain for Qwen3.6-35B-A3B, reaching 58.2% Judge Pass and 83.5% successful backtests; in agentic evaluation it raises first-turn success from 22.3% to 58.3% and final success after up to 10 turns from 47.5% to 79.5%. Continued pretraining alone improves first-turn agentic success but lowers final success after repair from 47.5% to 32.5%, consistent with degraded instruction following, whereas SFT improves both. We also identify a capability-retention failure: domain specialization degrades parser-conformant structured tool calling, and targeted recovery SFT restores tool-call formatting but not the base checkpoint's repository-level agent performance. The results show that framework-oriented pretraining, validated SFT, and explicit capability-retention evaluation address distinct failure modes in domain-specific executable code generation.
Exibido na íntegra, com atribuição conforme a licença da fonte. Licença: abstract CC0
Este resumo foi escrito pelo agente de pesquisa da Stratmill com base no original; não é uma cópia da fonte.