MARKET-BENCH: teste de LLMs em backtests de trading quantitativo
Resumo
MARKET-BENCH avalia se modelos de linguagem grandes conseguem transformar descrições de estratégias em linguagem natural e hipóteses de mercado em sistemas executáveis de backtesting. As tarefas incluem trading programado da Microsoft, trading de pares entre Coca-Cola e Pepsi e hedge delta da Microsoft. O benchmark compara os caminhos gerados de lucro e prejuízo, drawdown e posições com uma implementação de referência, medindo tanto se o backtest de um modelo é executado quanto o grau de correspondência dos resultados.
Uma avaliação em várias rodadas de treze modelos conclui que a maioria consegue executar a estratégia mais simples de forma confiável, enquanto os erros numéricos variam bastante entre modelos e tarefas. O artigo relata resultados fortes de vários modelos, incluindo execução perfeita para GPT-5.2, além de casos em que resultados executáveis ainda produzem trajetórias imprecisas. As conclusões sugerem que o sucesso da execução, por si só, não garante uma lógica de trading correta. Os resultados se limitam às tarefas introdutórias e às hipóteses do benchmark; não demonstram desempenho em estratégias mais complexas ou em mercados ao vivo.
Ideias principais
- O benchmark testa a geração de código para trading programado, trading de pares e hedge delta.
- Ele mede separadamente se os backtests são executados e o quanto seus resultados correspondem a uma referência.
- Treze modelos são avaliados em várias rodadas.
- Backtests executáveis ainda podem apresentar trajetórias imprecisas de lucro e prejuízo ou de posições.
- Os resultados abrangem tarefas introdutórias do benchmark e não demonstram capacidade de trading ao vivo.
Tags
Texto completo
# Market-Bench: Evaluating Large Language Models on Introductory Quantitative Trading and Market Dynamics # Market-Bench: Evaluating Large Language Models on Introductory Quantitative Trading and Market Dynamics We introduce MARKET-BENCH, a benchmark that evaluates large language models (LLMs) on introductory quantitative trading tasks by asking them to construct executable backtesters from natural language strategy descriptions and market assumptions. Each instance specifies one of three canonical strategies: scheduled trading on Microsoft (NASDAQ: MSFT), pairs trading on Coca-Cola (NASDAQ: KO) and Pepsi (NASDAQ: PEP), or delta hedging on MSFT. Models must produce code whose profit and loss (P and L), drawdown, and position paths match a verifiable reference implementation. We assess thirteen state-of-the-art models using a multi-round evaluation that separates structural reliability (whether the backtest runs) from numerical accuracy (mean absolute error of the backtest metrics), assigning failed outputs a duplicated-metrics baseline MAE. While most models reliably execute the simplest strategy (average executable passes of 4.08 out of 5 rounds), errors vary by orders of magnitude across models and tasks. Gemini 3 Pro and Claude 4.5 Sonnet combine strong reliability with low error on simpler strategies. GPT-5.2 achieves strong overall performance with perfect executability. GPT-5.1 Codex-Max achieves the lowest best-run error on the easiest task. Qwen3 Max attains perfect executability yet sometimes produces inaccurate profit and loss paths. These results show that current LLMs can scaffold basic trading infrastructure but still struggle to reason robustly about prices, inventory, and risk. We release MARKET-BENCH and a public leaderboard at https://marketbench.ai.
Exibido na íntegra, com atribuição conforme a licença da fonte. Licença: abstract CC0
Este resumo foi escrito pelo agente de pesquisa da Stratmill com base no original; não é uma cópia da fonte.