MARKET-BENCH : tester les modèles de langage sur le backtesting quantitatif
Résumé
MARKET-BENCH évalue si de grands modèles de langage peuvent convertir des descriptions de stratégies et des hypothèses de marché formulées en langage naturel en programmes de backtesting exécutables. Les tâches comprennent le trading à horaires programmés sur Microsoft, le trading par paires sur Coca-Cola et Pepsi, ainsi que la couverture delta sur Microsoft. Le benchmark compare les trajectoires de profits et pertes, de drawdown et de positions générées à une implémentation de référence, en mesurant à la fois si le backtest d’un modèle s’exécute et dans quelle mesure ses résultats concordent.
Une évaluation en plusieurs cycles de treize modèles montre que la plupart peuvent exécuter de façon fiable la stratégie la plus simple, tandis que les erreurs numériques varient fortement selon les modèles et les tâches. L’article rapporte de bons résultats pour plusieurs modèles, notamment une exécution parfaite pour GPT-5.2, mais aussi des cas où les résultats exécutables produisent des trajectoires inexactes. Les résultats suggèrent que la réussite de l’exécution ne suffit pas à garantir une logique de trading correcte. Ils se limitent aux tâches d’introduction et aux hypothèses du benchmark ; ils n’établissent pas les performances sur des stratégies plus complexes ni sur les marchés réels.
Idées clés
- Le benchmark teste la génération de code pour le trading à horaires programmés, le trading par paires et la couverture delta.
- Il mesure séparément si les backtests s’exécutent et dans quelle mesure leurs résultats concordent avec une référence.
- Treize modèles sont évalués en plusieurs cycles.
- Des backtests exécutables peuvent tout de même produire des trajectoires de profits et pertes ou de positions inexactes.
- Les résultats portent sur des tâches d’introduction du benchmark et n’établissent pas la capacité à trader sur les marchés réels.
Étiquettes
Texte intégral
# Market-Bench: Evaluating Large Language Models on Introductory Quantitative Trading and Market Dynamics # Market-Bench: Evaluating Large Language Models on Introductory Quantitative Trading and Market Dynamics We introduce MARKET-BENCH, a benchmark that evaluates large language models (LLMs) on introductory quantitative trading tasks by asking them to construct executable backtesters from natural language strategy descriptions and market assumptions. Each instance specifies one of three canonical strategies: scheduled trading on Microsoft (NASDAQ: MSFT), pairs trading on Coca-Cola (NASDAQ: KO) and Pepsi (NASDAQ: PEP), or delta hedging on MSFT. Models must produce code whose profit and loss (P and L), drawdown, and position paths match a verifiable reference implementation. We assess thirteen state-of-the-art models using a multi-round evaluation that separates structural reliability (whether the backtest runs) from numerical accuracy (mean absolute error of the backtest metrics), assigning failed outputs a duplicated-metrics baseline MAE. While most models reliably execute the simplest strategy (average executable passes of 4.08 out of 5 rounds), errors vary by orders of magnitude across models and tasks. Gemini 3 Pro and Claude 4.5 Sonnet combine strong reliability with low error on simpler strategies. GPT-5.2 achieves strong overall performance with perfect executability. GPT-5.1 Codex-Max achieves the lowest best-run error on the easiest task. Qwen3 Max attains perfect executability yet sometimes produces inaccurate profit and loss paths. These results show that current LLMs can scaffold basic trading infrastructure but still struggle to reason robustly about prices, inventory, and risk. We release MARKET-BENCH and a public leaderboard at https://marketbench.ai.
Reproduit dans son intégralité avec attribution, conformément à la licence de la source. Licence: abstract CC0
Ce résumé a été rédigé par l’agent de recherche de Stratmill à partir de la source originale ; il n’en est pas une copie.