Zum Inhalt springen
Alle Bibliotheksdokumente

MARKET-BENCH: LLMs mit quantitativen Trading-Backtests prüfen

Artikel arXiv papers · Autor: Abhay Srivastava et al.

Zusammenfassung

MARKET-BENCH untersucht, ob große Sprachmodelle natürlichsprachliche Strategiebeschreibungen und Marktannahmen in ausführbare Backtests umsetzen können. Die Aufgaben umfassen planmäßigen Handel mit Microsoft, Pair Trading mit Coca-Cola und Pepsi sowie Delta-Hedging mit Microsoft. Der Benchmark vergleicht die erzeugten Gewinn- und Verlust-, Drawdown- und Positionsverläufe mit einer Referenzimplementierung. Dabei wird sowohl gemessen, ob ein Modell-Backtest ausgeführt wird, als auch, wie genau seine Ergebnisse übereinstimmen.

Eine mehrstufige Bewertung von dreizehn Modellen ergibt, dass die meisten die einfachste Strategie zuverlässig ausführen können, während sich die numerischen Fehler zwischen Modellen und Aufgaben deutlich unterscheiden. Die Studie berichtet starke Ergebnisse mehrerer Modelle, darunter perfekte Ausführbarkeit für GPT-5.2. Zugleich gibt es Fälle, in denen ausführbare Ergebnisse weiterhin ungenaue Verläufe erzeugen. Die Ergebnisse legen nahe, dass eine erfolgreiche Ausführung allein keine korrekte Handelslogik gewährleistet. Sie beschränken sich auf die Einführungsaufgaben und Annahmen des Benchmarks und belegen daher keine Performance bei komplexeren Strategien oder an Live-Märkten.

Kernaussagen

  • Der Benchmark prüft die Codegenerierung für planmäßigen Handel, Pair Trading und Delta-Hedging.
  • Er misst getrennt, ob Backtests ausführbar sind und wie genau ihre Ergebnisse mit einer Referenz übereinstimmen.
  • Dreizehn Modelle werden in mehreren Durchläufen bewertet.
  • Ausführbare Backtests können trotzdem ungenaue Gewinn- und Verlust- oder Positionsverläufe aufweisen.
  • Die Ergebnisse betreffen einführende Benchmark-Aufgaben und belegen keine Fähigkeit zum Live-Trading.

Schlagwörter

Volltext
# Market-Bench: Evaluating Large Language Models on Introductory Quantitative Trading and Market Dynamics


# Market-Bench: Evaluating Large Language Models on Introductory Quantitative Trading and Market Dynamics









We introduce MARKET-BENCH, a benchmark that evaluates large language models (LLMs) on introductory quantitative trading tasks by asking them to construct executable backtesters from natural language strategy descriptions and market assumptions. Each instance specifies one of three canonical strategies: scheduled trading on Microsoft (NASDAQ: MSFT), pairs trading on Coca-Cola (NASDAQ: KO) and Pepsi (NASDAQ: PEP), or delta hedging on MSFT. Models must produce code whose profit and loss (P and L), drawdown, and position paths match a verifiable reference implementation. We assess thirteen state-of-the-art models using a multi-round evaluation that separates structural reliability (whether the backtest runs) from numerical accuracy (mean absolute error of the backtest metrics), assigning failed outputs a duplicated-metrics baseline MAE. While most models reliably execute the simplest strategy (average executable passes of 4.08 out of 5 rounds), errors vary by orders of magnitude across models and tasks. Gemini 3 Pro and Claude 4.5 Sonnet combine strong reliability with low error on simpler strategies. GPT-5.2 achieves strong overall performance with perfect executability. GPT-5.1 Codex-Max achieves the lowest best-run error on the easiest task. Qwen3 Max attains perfect executability yet sometimes produces inaccurate profit and loss paths. These results show that current LLMs can scaffold basic trading infrastructure but still struggle to reason robustly about prices, inventory, and risk. We release MARKET-BENCH and a public leaderboard at https://marketbench.ai.

Vollständig mit Quellenangabe unter der Lizenz der Quelle angezeigt. Lizenz: abstract CC0

Diese Zusammenfassung wurde vom Research-Agenten von Stratmill anhand des Originals verfasst; sie ist keine Kopie der Quelle.