MARKET-BENCH: pruebas de backtesting de trading cuantitativo con LLM
Resumen
MARKET-BENCH evalúa si los modelos de lenguaje grandes pueden convertir descripciones de estrategias en lenguaje natural y supuestos de mercado en sistemas ejecutables de backtesting. Las tareas abarcan trading programado con Microsoft, trading de pares con Coca-Cola y Pepsi, y cobertura delta con Microsoft. El referente compara las trayectorias generadas de pérdidas y ganancias, drawdown y posiciones con una implementación de referencia, y mide tanto si se ejecuta el backtest del modelo como cuánto coinciden sus resultados.
Una evaluación en varias rondas de trece modelos concluye que la mayoría puede ejecutar de forma fiable la estrategia más sencilla, mientras que los errores numéricos varían mucho entre modelos y tareas. El artículo comunica buenos resultados de varios modelos, incluida la ejecución perfecta de GPT-5.2, junto con casos en que las salidas ejecutables siguen produciendo trayectorias inexactas. Los resultados sugieren que lograr la ejecución no garantiza por sí solo una lógica de trading correcta. Los resultados se limitan a las tareas introductorias y los supuestos del referente, por lo que no demuestran el rendimiento con estrategias más complejas ni en mercados reales.
Ideas clave
- El referente evalúa la generación de código para trading programado, trading de pares y cobertura delta.
- Mide por separado si los backtests se ejecutan y cuánto se aproximan sus resultados a una referencia.
- Se evalúan trece modelos en varias rondas.
- Los backtests ejecutables aún pueden producir trayectorias inexactas de pérdidas y ganancias o de posiciones.
- Los resultados abarcan tareas introductorias del referente y no demuestran capacidad para el trading real.
Etiquetas
Texto completo
# Market-Bench: Evaluating Large Language Models on Introductory Quantitative Trading and Market Dynamics # Market-Bench: Evaluating Large Language Models on Introductory Quantitative Trading and Market Dynamics We introduce MARKET-BENCH, a benchmark that evaluates large language models (LLMs) on introductory quantitative trading tasks by asking them to construct executable backtesters from natural language strategy descriptions and market assumptions. Each instance specifies one of three canonical strategies: scheduled trading on Microsoft (NASDAQ: MSFT), pairs trading on Coca-Cola (NASDAQ: KO) and Pepsi (NASDAQ: PEP), or delta hedging on MSFT. Models must produce code whose profit and loss (P and L), drawdown, and position paths match a verifiable reference implementation. We assess thirteen state-of-the-art models using a multi-round evaluation that separates structural reliability (whether the backtest runs) from numerical accuracy (mean absolute error of the backtest metrics), assigning failed outputs a duplicated-metrics baseline MAE. While most models reliably execute the simplest strategy (average executable passes of 4.08 out of 5 rounds), errors vary by orders of magnitude across models and tasks. Gemini 3 Pro and Claude 4.5 Sonnet combine strong reliability with low error on simpler strategies. GPT-5.2 achieves strong overall performance with perfect executability. GPT-5.1 Codex-Max achieves the lowest best-run error on the easiest task. Qwen3 Max attains perfect executability yet sometimes produces inaccurate profit and loss paths. These results show that current LLMs can scaffold basic trading infrastructure but still struggle to reason robustly about prices, inventory, and risk. We release MARKET-BENCH and a public leaderboard at https://marketbench.ai.
Se muestra íntegramente con atribución según la licencia de la fuente. Licencia: abstract CC0
Este resumen lo redactó el agente de investigación de Stratmill a partir del original; no es una copia de la fuente.