Zum Inhalt springen
Alle Bibliotheksdokumente

MintEval: Prüfen, ob LLM-Handelscode der Spezifikation entspricht

Artikel arXiv papers · Autor: Siyu Wang et al.

Zusammenfassung

MintEval bewertet, ob Sprachmodelle Handelsanweisungen in Code übersetzen, der sich wie die beabsichtigte Strategie verhält. Das Verfahren erstellt Referenzstrategien aus kombinierbaren Komponenten, formuliert sie in umgangssprachliche Anweisungen um und lässt Modelle diese implementieren. Die erzeugten und die Referenzprogramme werden auf denselben Marktdaten und mit denselben Transaktionsfriktionen Balken für Balken ausgeführt; ihre Aktionen werden verglichen. So verfälschen Unterschiede in der Marktentwicklung den Vergleich der Implementierungstreue nicht.

Die erste Benchmark umfasst 800 Aufgaben mit BTCUSDT 15-Minuten-Daten, gruppiert nach der anhand der Ausführung gemessenen Komplexität der Zustandsdauer. Die berichteten Ergebnisse zeigen erhebliche Leistungsunterschiede zwischen Modellen: Kostengünstigere Modelle erreichen nur eine begrenzte Aktionsübereinstimmung und exakte Reproduktion. Ein Frontier-Modell schneidet bei einer Teilmenge von 200 Aufgaben besser ab, weist aber weiterhin unbemerkte Fehler auf. Selbst wenn Modelle die verlangten Bausteine korrekt erkennen, weichen viele Implementierungen in aktiven Balken von der Spezifikation ab. Die Autoren berichten außerdem, dass ein LLM-Beurteiler alle derartigen Fehler akzeptierte. Die Benchmark misst Verhaltensäquivalenz bei den festgelegten Aufgaben und Daten; sie belegt weder Profitabilität im Handel noch eine automatische Übertragbarkeit auf andere Märkte und Strategietypen.

Kernaussagen

  • Die Benchmark vergleicht ausgeführte Handelsaktionen, nicht die Ähnlichkeit des Quellcodes oder den Gewinn.
  • Referenzstrategien werden programmgesteuert aus Bausteinen zusammengesetzt und in informelle Handelsanweisungen übersetzt.
  • Beide Implementierungen verwenden dieselben Marktdaten und Transaktionsfriktionen, um Verhaltensunterschiede herauszuarbeiten.
  • Die Leistung wird anhand von Aufgaben bewertet, die nach der ausführungsbasierten Komplexität der Zustandsdauer gruppiert sind.
  • Eine korrekte Erkennung der Strategiespezifikation garantiert nicht, dass der erzeugte Code sie getreu umsetzt.

Schlagwörter

Volltext
# 2610.03080


# MintEval: Do LLMs Implement the Trading Strategy You Asked For? A Behavioural-Equivalence Benchmark for Natural-Language-to-Strategy Code









Large language models are moving from producing trading signals to writing the code that executes them. The failure mode of the second role is silent: generated code runs, a backtest plots, yet the risk logic that the trader described is not the logic being executed. Existing code benchmarks test functional correctness on unit tests and finance benchmarks test forecasting; neither measures whether an implementation behaves like the strategy that was asked for. We introduce MintEval, a benchmark in which reference strategies are generated programmatically from a library of composable building blocks, back-translated into colloquial trader instructions, and re-implemented by the model under test. Generated and reference programs are executed bar by bar on identical market data and frictions, and compared on their actions rather than on code similarity or profit: alpha is differenced away. MintEval v0 contains 800 tasks on BTCUSDT 15-minute data, stratified by an execution-measured state-span complexity tau that is decoupled from description length. Low-cost models reach a mean ActionMatch of at most 0.544 and reproduce at most 0.087 of tasks exactly; on a stratified subset of 200 tasks a frontier model (Claude Opus 5.5) reaches 0.889 and reproduces 0.575 exactly, yet still fails silently on 0.275 of tasks. Given a menu of building blocks, models identify the strategy almost perfectly, yet 79.2% of the implementations whose specification was read correctly diverge on more than 10% of active bars. The LLM judge of a recent strategy-generation benchmark, applied verbatim, accepts every one of these silent failures.

Vollständig mit Quellenangabe unter der Lizenz der Quelle angezeigt. Lizenz: abstract CC0

Diese Zusammenfassung wurde vom Research-Agenten von Stratmill anhand des Originals verfasst; sie ist keine Kopie der Quelle.